Deep Paper Reading · Self-Developing Agents

自测、自判,真的会让 LLM 变好吗?

《S³Gym》把“模型能否从自己的交互经验中成长”拆成可审计的三段:Self-Testing 产生证据,Self-Judging 判断什么有效,Self-Improvement 把判断转成下一轮行为。结果很克制:有时能学会,但不存在跨任务、跨模型、跨记忆形态的万能答案。

Jiajun Shi 等 21 位作者ByteDance Seed · M-A-P · TokenWave.AIarXiv:2608.31100v1 · 2026-08-31cs.CL论文PDF官方项目页

一句话结论

S³Gym 的关键贡献不是提出一个更强的 agent,而是把“经验是否变成能力”做成了一个有外部 verifier、分离探索/评估、可以诊断失败来源的 benchmark。

Paper Verified
7

七个 text-based、规则可执行验证的游戏,覆盖隐规则归纳、约束满足、数值变换、空间规划、资源分配、生存和多智能体策略。

三条路径
3

同一类探索经验分别通过 raw History ICL、Summary Memory、parameter Training 进入下一轮行为。

判断耦合
−0.010

事件 Agreement 与下一评估增益的总体相关系数 \(\rho(A,g)\) 接近零;校准误差相关也仅 −0.018。

风险边界
23 → 6

Qwen3-8B 参数训练在 PvZ 上从初始 23 降到每个更新 checkpoint 的 6;Trust Evolution 则从 0 上升到最高 30。

我的阅读判断

S³Gym 证明的是“经验到行为的转化可以被测量,且偶尔成功”,不是“自我评价可靠”或“自我改进已经普遍实现”。最有解释力的结论是:局部地识别一个好动作,和把它抽象成跨状态可执行的策略,是两个不同难度的能力。

论文身份与资料状态

项目核验结果一手来源
准确题名S³Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?arXiv record
版本与日期v1,提交于 2026-08-31 17:05:41 UTC;当前记录为 arXiv preprintSubmission history
领域Computer Science > Computation and Language(cs.CL)arXiv HTML
作者与机构Jiajun Shi, Siyuan Tao, Yuhao Wu, Zexuan Wang, Jingyuan Zhang, Jiaheng Liu, Xinping Lei, Xinrong Zhang, Siyuan Fang, Zhewen Tan, Tianle Cai, Junhao Fang, Jiameng Huang, Yueyang Wang, Jinkai Liu, Yuxuan Zhang, Jian Yang, Zhoujun Li, Shen Yan, Wenhao Huang, Ge Zhang;affiliations 为 ByteDance Seed、M-A-P、TokenWave.AIarXiv authors · Contributions
官方项目页Self-Developing Agents 系列主页把三篇工作对应为 TARGET / EXPERIENCE / SYSTEM 三个问题;S³Gym 位于 EXPERIENCE。Project page
代码状态论文附录说明提示模板来自 test/S3GYM/envs/*/prompt.py,但 arXiv 页面和官方项目页没有列出可直接克隆的代码仓库链接;环境实现、API 调用配置和训练脚本未随本文一同公开。Appendix A
venue 状态来源明确支持 arXiv v1 与 cs.CL;未在论文一手资料中核验到会议接收信息,因此不把它写成 conference paper。源记录
复现透明说明

下面的配置、数字和 prompt 结构尽量直接来自 PDF/TeX/Appendix。未公开的 optimizer、API temperature、完整 system prompt 内容、环境源码、随机种子清单和参数训练数据构建脚本,不会被自行补全为论文事实。

动机:固定策略分数看不出“学会了”

传统 agent benchmark 通常给定任务、奖励、执行脚手架和评估集,然后把模型当作固定 policy 测一次。它回答的是“模型现在有多强”,却不回答“模型是否能利用自己刚才做过的事”。现实中的 agent 则不断经历观察、推理、行动和反馈,留下大量 trajectory;如果这些轨迹不能改变后续决策,经验只是日志,不是学习。

Self-Testing

产生有信息量的证据

主动尝试策略、探索状态、观察部分可见后果,不能只等待一次最终分数。

Self-Judging

解释发生了什么

对动作的即时价值、自身失败和潜在可复用性作判断。这里的 score 旨在预测规则下动作会得到的 immediate reward,而不是泛化的主观置信度。

Self-Improvement

改变下一次行为

将判断沉淀为 raw history、外部 memory 或参数更新,并在新配置上真的获得更高表现。

研究缺口

已有 interactive benchmark 有丰富的多轮轨迹,但多半只把轨迹用于打分或失败分析;Reflexion、Voyager、STaR、ReST 等工作展示了经验/自生成监督可以促进改进,却往往绑定单一的改善机制,使得“经验没信息”“自判错了”“更新机制不会迁移”三种失败来源难以区分。S³Gym 试图在相同的环境、种子、预算和严格评估下比较三条经验整合路径,并把模型自判与环境 verifier 的信号同时记录下来。

论文 Figure 1:人类与 LLM 的自测、自判、自我改进概念图
Figure 1 · 论文概念图。左侧用人类的测试—判断—学习作类比,右侧对应 LLM agent 的探索、轨迹/分数记录,以及 ICL、Memory、Training 三种改进路径。原图:arXiv figure asset
Paper Verified

论文将问题限定在可执行的 text games:多轮交互、部分可观测、延迟后果和长时程决策提供“经验”,规则 verifier 提供客观的 step-level / terminal score。这样既能模拟经验积累,又能避免人工评审成为唯一裁判。

问题定义与数学骨架

每个游戏由许多独立 episode 组成。一个 episode 是一段交互 trajectory;模型同时输出动作与对“该动作即时奖励”的自判分数,环境则悄悄保存 verifier 的真实 step reward。关键是 \(s_{x,i}\) 不等同于 confidence,\(r_{x,i}\) 在主探索设置中不返回给 agent。

符号含义所在层
\(x\)episode 索引数据组织
\(i\)episode 内 step 索引交互时序
\(c_x,\operatorname{seed}_x\)第 \(x\) 个 episode 的 game configuration 与随机种子环境初始化
\(O_{x,i}\)当前 text observation / board stateagent 输入
\(H_{x,i}\)当前 episode 的已发生交互历史agent 输入
\(a_{x,i}\)坐标、方向、落子或策略选择等动作agent 输出
\(s_{x,i}\)agent 对动作即时奖励的 self-judged score内部判断
\(F_{x,i}\)环境返回、可继续用于交互的 observable feedback环境反馈
\(r_{x,i}\)环境 verifier 计算的 step-level ground truth reward外部审计
\(d_{x,i}\)终止信号环境控制
\(y_x\)完整 trajectory 的 final environment score评估指标
\(\theta_t,Z_t^{(p)}\)第 \(t\) 轮模型参数与路径 \(p\) 的经验状态跨 episode 记忆/更新

一个 self-improvement cycle

\[\mathcal{R}_{t}^{(p)}=\mathrm{Explore}\rightarrow\mathrm{Judge}\rightarrow\mathrm{Consolidate}\rightarrow\mathrm{Update}_{p}\rightarrow\mathrm{Evaluate}\]

这里 \(t\) 是 cycle index,\(p\in\{\mathrm{History},\mathrm{Memory},\mathrm{Training}\}\) 是经验进入未来行为的路径。公式是一个 schedule:它并不假设三个 \(p\) 会同样有效,只保证每条路径共享探索与严格评估的外部条件。

交互一步发生什么

\[O_{x,0}=\operatorname{Reset}(\operatorname{seed}_{x},c_x),\qquad H_{x,0}=\varnothing\]

episode 从配置与 seed 重置,初始 history 为空。下一步模型接收当前观察、episode 内历史,以及此前 cycle 的路径特定经验:

\[(a_{x,i},s_{x,i})=\pi_{\theta_t}\!\left(O_{x,i},H_{x,i};Z_t^{(p)}\right)\]

环境执行提议动作并返回下一观察、可见反馈、隐藏于 agent 的 verifier reward 和终止位:

\[(O_{x,i+1},F_{x,i},r_{x,i},d_{x,i})=\operatorname{Env}(O_{x,i},a_{x,i})\]

进入下一步时,agent 能看到的是带有自己分数的格式化 transition:

\[H_{x,i+1}=H_{x,i}\oplus\operatorname{Format}\!\left(O_{x,i},a_{x,i},s_{x,i},F_{x,i},O_{x,i+1}\right)\]

其中 \(\oplus\) 表示有序拼接;\(r_{x,i}\) 留在 benchmark 侧,因此评估可以在不泄露答案的情况下比较 \(s\) 与 \(r\)。episode 结束或达到步数上限后:

\[y_x=\operatorname{Score}(\tau_x)\]

\(r_{x,i}\) 用来审计 Self-Judging,\(y_x\) 用来衡量严格条件下的完整行为。二者都不作为主探索阶段直接返回给模型。

最重要的控制

如果把 verifier reward 在探索时直接反馈给 agent,模型就可能依赖一个外部老师,而不是暴露自身 self-judgment。S³Gym 的判断可靠性分析正是建立在“模型说的 \(s\)”和“环境实际的 \(r\)”被并行记录但交互时隔离之上。

完整方法:同样的经验,三种持久化方式

探索配置相对宽松,评估配置更严格;每隔若干探索 episode 做一次更新与 held-out eval。方法图中最容易忽略的一点是:Evaluation trajectory 永远不回流到 history、memory 或 training data,且探索与评估使用 disjoint seeds。

论文 Figure 2:七个规则可验证游戏、探索、self-judging、经验整合和严格评估
Figure 2 · S³Gym 方法总览。原始图将 7 个游戏、探索交互、隐藏环境分数、三种经验整合和周期性 held-out evaluation 放在一张图里。图中 \(y_x\) 在探索期间标为 hidden;来源:arXiv figure asset
1 · Explore宽松配置跑 \(N_{\mathrm{exp}}\) 个 episode,尝试策略、积累 trajectory。
2 · Judge每一步输出 action + self-score;环境真实 reward 不展示。
3 · Consolidate保留 raw history,或压缩为策略/错误/下一步方向。
4 · Updatep更新 context state、memory,或参数 \(\theta\)。
5 · Evaluate严格配置 + 新 seed,比较 final score、提升与泛化。

把 benchmark 看作“经验转移实验”,而不是一次性游戏 leaderboard。

路径 A · History ICL

\[C_{t+1}=\operatorname{Serialize}\!\left(C_t,\mathcal{T}_{t}^{\mathrm{exp}},\mathcal{S}_{t}^{\mathrm{exp}}\right),\qquad Z_{t+1}^{(\mathrm{History})}=C_{t+1}\]

把带 score 的探索轨迹直接序列化并追加到未来 context。优点是证据细节完整,缺点是 context budget 会成为瓶颈,也让模型自己从长轨迹中定位因果信息。

路径 B · Summary Memory

\[M_{t+1}=\operatorname{Summarize}\!\left(M_t,\mathcal{T}_{t}^{\mathrm{exp}},\mathcal{S}_{t}^{\mathrm{exp}}\right)=\left(R_{t}^{\mathrm{retain}},R_{t}^{\mathrm{avoid}},D_{t}^{\mathrm{next}}\right)\]

将 trajectory 压缩成“保留哪些策略、避免哪些错误、下一轮怎么做”。它更节省上下文,却引入强信息瓶颈:摘要必须足够具体,才能从描述性的经验变成新状态上的 action rule。

路径 C · Parameter Training

\[\mathcal{D}_{t}^{\mathrm{SFT}}=\operatorname{BuildSFT}\!\left(\mathcal{T}_{t}^{\mathrm{exp}},\mathcal{S}_{t}^{\mathrm{exp}}\right),\qquad \theta_{t+1}=\operatorname{SFT}\!\left(\theta_t,\mathcal{D}_{t}^{\mathrm{SFT}}\right)\]

高分动作可作为正例;低分动作被过滤或替换成 corrected action,组成 supervised fine-tuning 数据。它具有最强的持久性,也最可能把错误判断、探索偏差或宽松配置过拟合进参数。论文将这一项作为 auxiliary pathway 进行独立的 Qwen3-8B 分析,而不是与七模型 context 表直接混排。

Paper Verified

三条路径从同一 base model 出发,使用同一 exploration seeds、evaluation seeds、interaction budget 和 decoding settings;改变的是经验的组织/更新方式。

七个游戏:让“迁移”具体化

每个游戏保留任务身份,但改变 state space、失败代价、机会数量或 opponent sampling,使 evaluation 不只是重复探索。Max steps 取 game-specific horizon 与 controller cap 中更严格者。

Game探索配置(较宽松)严格评估配置最大步数主要能力
Chess15×15 board,12 pieces,7-step history相同规则,但 22 pieces5隐规则/状态归纳
Minesweeper9×9,10–20 mines,额外两条命第一次踩雷即终止64约束满足
Nullify3–7 construction steps5–10 construction steps50数值变换/组合规划
Plants-vs-Zombies3×7 battlefield5×6 battlefield64资源分配/长时程策略
Snake碰撞与非法动作当作 no-op碰撞与非法动作终止 episode64反应式空间控制
Tetris10×10 board8×8 board64空间规划/表面管理
Trust Evolutionopponent 偏向较容易策略opponent strategies uniform sampling10对手建模/社会策略

Table 2 · 论文环境设置的可读版。探索不一定总是“更小”,核心是不改变任务问题而降低失败成本或缩小搜索难度。来源:arXiv §5.1

Agent 看到什么、必须输出什么

Game主要 observation合法动作形态score 语义
ChessN×N board,标记 pieces 与空格一个或多个 piece 的坐标预测预测正确的即时位置数/规则得分
Minesweeper部分揭示的数字、旗帜、未知格uncover / flag / unflag正确标记 mine 的比例
Nullify带索引的 signed values 与 operators选择两个 unit index完成抵消为 1,否则终局为 0
Tetris固定块 board + next blockdrop column + rotation angle本步/最终清除的行数
Snake墙、head、body、food、obstacles、方向LEFT/RIGHT/UP/DOWN吃到 apple 等即时生存奖励
PvZbattlefield、sun、plants、zombies、turn零个或多个 plant placements每 survived turn 增加 1
Trust Evolutionround 与 interaction/payoff historycollaborate / cheat依据 payoff matrix 的本轮收益
Answer: <ACTION>, Score: <SELF-JUDGED SCORE>. If the episode has terminated: Answer: END, Score: 0.

这是附录给出的 shared response contract。六个游戏共享基础交互协议,Trust Evolution 使用自己的 game-specific system instruction;memory 条件改变的是 cross-episode experience 的呈现,不改变游戏规则、动态状态、合法动作空间和 self-judging contract。

Appendix A 的 prompt 级实现要点

History ICL:上一轮保留的每一步被序列化为 Env: <STATE>LLM: Answer: <ACTION>, Score: <SELF-SCORE>;当前 episode history 与当前 game prompt 完整保留,超出 context budget 时截断上一轮历史的尾部。

Summary Memory:每个 episode 的 step 0 先用 game rule + 截断的上一轮 history 做一次独立 compression call,抽取 Tips;Tips 在 session 内缓存,后续 action-time input 仍附带当前 episode 的 raw history。也就是说它只压缩跨 episode 经验,不压缩当前状态。

重要限制:TeX 源把这些 prompt 称为从 test/S3GYM/envs/*/prompt.py 转录而来,但源码包只包含论文材料,不包含这些环境文件本身。因此这里能复述接口,却不能声称已核验完整代码实现。

实验设置与可复现边界

Context-level 主实验

Setting论文值解释
ModelsGPT-4o、GPT-4.1、o3-mini、Gemini-2.5-Flash、Gemini-2.5-Pro、GPT-5.5、Gemini-3.5-Flash七个游戏结果完整的 proprietary LLM 才进入主表
History-ICL input limit100,000 tokens上一轮 raw history 的 context 上限
Output generation cap14,000 new tokens / response单次回答生成上限
Controller interaction cap64 steps / episode游戏自身 horizon 更小时以游戏配置为准
Exploration budget30 episodes每个 game / model / pathway 的探索上限
Evaluation interval每 3 个 exploration episodescheckpoint \(x\in\{0,3,6,\ldots,30\}\)
Evaluation set3 strict-mode episodes / checkpoint与 exploration 使用 disjoint seeds
Evaluation data flow不回流评估轨迹不写入 history、memory 或 training data

如何读三项曲线指标

令 \(y_{m,p,g,k}\) 表示 model \(m\)、pathway \(p\)、game \(g\) 在 checkpoint \(x_k\) 的严格评估分数。论文同时报告:

\[\operatorname{Avg}_{m,p,g}=\frac{1}{K+1}\sum_{k=0}^{K}y_{m,p,g,k}\]
\[\operatorname{Max}_{m,p,g}=\max_{0\leq k\leq K}y_{m,p,g,k}\]
\[\operatorname{AUC}^{+}_{m,p,g}=\int_{0}^{30}\max\!\left(0,y_{m,p,g}(x)-y_{m,p,g,0}\right)\,\mathrm{d}x\]

Avg 反映整个过程的平均能力,Max 捕捉偶然的 capability breakthrough,AUC+ 衡量高于初始 baseline 的持续面积;曲线在 checkpoint 间用 piecewise-linear interpolation。不同游戏分数尺度差异很大,所以 raw AUC+ 只能在同一游戏内部比较。

参数训练的独立分析

RQ1 使用 Qwen3-8B 的 20 个 consecutive checkpoints:epoch 0 是原始模型,epoch 1–19 是由 exploration trajectories 更新后的模型;评估时不带 History ICL 或 Summary Memory。论文公开了训练曲线与行为结果,但没有在正文/附录给出 optimizer、learning rate、batch size、epoch 内数据量、LoRA/全量更新选择、训练硬件或完整 filtering script,故这些项目在本页标记为“未报告”。

复现风险

“同一 interaction budget 和 decoding settings”足以支持方法间的协议比较,但不是完整的随机性审计。proprietary model 版本、服务端采样实现、并发失败的处理以及未公开的环境代码,都会影响独立复现实验。

主结果:没有 universal memory winner

下表完整保留论文 Table 4 的 Avg、Max 与 AUC+ 数值。粗体在原论文表示对应 pathway/game 内最优;这里通过 绿色 标示同一块内的原始 best。

Avg · 全部模型与游戏

Pathway / ModelChessMinesweeperNullifyTetrisSnakePvZTrust Evo
History ICL
GPT-4o0.0070.0440.0300.0300.21211.6368.242
GPT-4.10.0100.0420.0300.1520.51516.9097.371
o3-mini0.0120.2220.0301.2734.00026.3339.242
Gemini-2.5-Flash0.0090.0630.0300.1211.42420.6979.008
Gemini-2.5-Pro0.0250.4210.2120.2731.57628.24214.500
GPT-5.50.0170.6040.5454.2429.06144.0337.848
Gemini-3.5-Flash0.5470.4820.3941.9708.45544.69717.242
Summary Memory
GPT-4o0.0050.0130.0000.0300.30311.81813.947
GPT-4.10.0100.0120.0300.1820.54514.72713.371
o3-mini0.0060.4250.0611.7886.72726.4247.174
Gemini-2.5-Flash0.0740.4380.0910.1521.36421.9398.720
Gemini-2.5-Pro0.1100.4660.1820.5451.27319.6679.568
GPT-5.50.5330.7420.5763.51510.69733.5008.697
Gemini-3.5-Flash0.2080.6030.4551.09110.24243.87914.394

Max · 偶然峰值与稳定能力不是一回事

Pathway / ModelChessMinesweeperNullifyTetrisSnakePvZTrust Evo
History ICL
GPT-4o0.0180.1310.3330.3330.66717.66711.500
GPT-4.10.0180.1890.3330.6671.66721.66710.250
o3-mini0.0220.5000.3332.6679.66729.33313.250
Gemini-2.5-Flash0.0220.6700.3330.3332.33329.00013.583
Gemini-2.5-Pro0.0890.6590.6671.0004.33333.00019.000
GPT-5.50.0670.9741.00011.33311.33348.00023.000
Gemini-3.5-Flash0.7420.7051.0003.00013.00062.66721.000
Summary Memory
GPT-4o0.0180.0330.0000.3331.00020.33319.333
GPT-4.10.0310.0830.3330.6671.00019.33315.917
o3-mini0.0180.6080.3334.00010.33329.00010.083
Gemini-2.5-Flash0.1470.6650.3330.6672.33326.33313.750
Gemini-2.5-Pro0.2580.9740.3332.0003.00026.66714.333
GPT-5.50.7731.0001.0006.66714.00041.33317.000
Gemini-3.5-Flash0.5240.9611.0002.33312.00051.66720.333

AUC+ · 持续高于 baseline 的面积

Pathway / ModelChessMinesweeperNullifyTetrisSnakePvZTrust Evo
History ICL
GPT-4o0.2331.4370.5001.0000.0000.0523.443
GPT-4.10.1861.3291.0000.0008.501129.0005.966
o3-mini0.0040.0001.0000.0000.0005.38362.638
Gemini-2.5-Flash0.0170.0001.0000.0007.31724.4026.251
Gemini-2.5-Pro0.0003.5391.5000.0000.00060.416161.876
GPT-5.50.4740.9591.00096.2510.163548.499164.411
Gemini-3.5-Flash12.2801.2170.41734.00037.387161.945200.000
Summary Memory
GPT-4o0.0070.0460.0000.5001.91712.77810.350
GPT-4.10.1770.0461.0000.0000.00075.462154.876
o3-mini0.0790.0012.00028.5980.30040.42530.521
Gemini-2.5-Flash2.1477.7943.0000.5000.000238.50118.443
Gemini-2.5-Pro0.5730.7210.00010.08411.32111.87210.624
GPT-5.516.8402.9517.41850.8010.00033.219240.500
Gemini-3.5-Flash0.0000.7935.58415.8080.750123.53555.095

Table 4 · 主结果。明确标记的 concurrency failures 被排除;AUC+ 按 checkpoint 间梯形积分。完整原表:arXiv §5.3

读表方式

不要把 AUC+ 横跨游戏平均。PvZ 的原始数值天然比 Chess 大很多;“谁赢”必须限定在同一个 game、同一指标、同一 pathway 内。Max 变大但 Avg/AUC+ 不变,往往只是一次成功而非稳定改进。

Gemini-2.5-Flash · Minesweeper
0 → 7.794
Gemini-2.5-Flash · PvZ
24.402 → 238.501
GPT-5.5 · Chess
0.474 → 16.840
GPT-5.5 · PvZ
548.499 → 33.219

绿色条表示 Summary Memory 方向的相对改善示例,蓝色条表示摘要后明显下降;条形只用于阅读提示,不把不同游戏的绝对尺度混在一起。

RQ1:参数训练能否把经验内化?

Qwen3-8B 的训练实验把 memory 从 inference context 中拿走,只保留由 exploration trajectories 和 self-judgments 构成的参数更新。它回答的是更强的持久性问题:如果未来没有历史轨迹,模型是否还能表现得更好?

Trust Evolution
0 → 30

最高分 30,19 个更新 checkpoint 中有 18 个高于初始 baseline;post-training Avg 为 8.684,AUC+ 为 163.5。

PvZ
23 → 6

初始分数 23,所有更新 checkpoint 都是 6,持续负迁移;论文只列出可能原因,没有证明是哪一个。

稀疏成功
3 games

Chess 只在 final 达到 0.0667;Snake 在 epoch 8、12、15 达到 1 后又回到 0;Minesweeper、Nullify、Tetris 全程为 0。

Qwen3-8B 参数训练结果的定性重绘Trust Evolution 由 0 上升至 30,Plants-vs-Zombies 由 23 降至 6,其余任务大多保持在 0 附近。3020100Trust Evolution · max 30PvZ · every update = 6epoch 0epoch 19其他游戏大多接近 0(Snake 仅间歇到 1)
Figure 7 · 依据论文训练曲线和文字结果的定性重绘;不虚构未报告的中间 checkpoint 数值。原始图文件在 TeX source 的 pics/trends/train_qwen3_8b_direct.pdf,可从 PDF 查看。
作者解释 ≠ 已证因果

PvZ 的持续下降可能来自对宽松探索轨迹的过拟合、探索/严格评估的配置错配,或不可靠 Self-Judging;当前实验只建立了“参数更新可能覆盖原本有效行为”的事实,不能从曲线判定具体机制。

RQ2:模型的 Self-Judging 可靠吗?

每个 transition 同时保留模型的 \(s_i\) 与环境的 \(r_i\)。论文统计七个模型、七个游戏、两种 context pathway,共 98 runs、116,117 transitions。它使用四类信号:正/非正事件 Agreement、归一化数值误差 NMAE、over-confidence 和 under-confidence。

\[\mathrm{Agree}=\frac{1}{N}\sum_{i=1}^{N}\mathbf{1}\!\left[\mathbf{1}(s_i\gt 0)=\mathbf{1}(r_i\gt 0)\right]\]

Agreement 只问“模型与 verifier 是否都认为这一步有正收益”,不问收益有多大。由于不同游戏 reward scale 不同,论文再用 game-level min–max normalization 计算:

\[\mathrm{NMAE}=\frac{1}{N}\sum_{i=1}^{N}\left|\frac{s_i-s_{\min}}{s_{\max}-s_{\min}}-\frac{r_i-r_{\min}}{r_{\max}-r_{\min}}\right|\]

此外,over-confidence 是 \(\Pr(s_i\gt 0,r_i\leq 0)\),under-confidence 是 \(\Pr(s_i\leq 0,r_i\gt 0)\)。高 Agreement 可能只是因为绝大多数 transition 的真实 reward 都是 0,因此必须和 NMAE 一起读。

GameAgreement ↑NMAE ↓Over-conf. ↓Under-conf. ↓阅读
Chess0.4960.1410.3650.139事件判断接近随机,过度自信最高
Minesweeper0.8200.5240.0620.118事件 Agreement 高,但数值校准弱
Nullify0.8270.0560.1700.004数值校准较好
PvZ0.8810.8820.0320.087Agreement 最高但 NMAE 也最高
Snake0.8790.1210.1100.011事件判断强,仍有局部误判
Tetris0.8460.0410.1510.002NMAE 最低,校准最好之一
Trust0.6650.3920.2910.044隐藏对手策略导致过度自信

Table 5 · Self-Judging step-level reliability。来源:arXiv §6.2

核心发现

PvZ 的 Agreement 0.881 看起来很好,但 NMAE 0.882,说明模型经常知道“这一步有/没有正收益”,却严重估错收益幅度。Chess 的 Agreement 0.496 + over-confidence 0.365 则是最直接的失败案例。自判的二值正确不等于可复用的策略知识。

Judgment–improvement coupling

为检验“自判越准,下一轮越会提升”是否成立,论文把相邻评估 checkpoint 间的探索 episode 分成 block \(B_t\),计算 block 的 agreement \(A_t\)、calibration error \(E_t\),以及随后严格评估的归一化增益:

\[g_t=\frac{y_t-y_{t-3}}{\max_{g,\tau}y_{g,\tau}-\min_{g,\tau}y_{g,\tau}}\]

再比较 \(\rho(A_t,g_t)\)、\(\rho(-E_t,g_t)\) 和高/低判断质量 tertile 的 gain gap。

Game\(\rho(A,g)\)\(\rho(-E,g)\)GapAGapE
All−0.010−0.018−0.004−0.016
Chess−0.014−0.0580.028−0.039
Minesweeper0.0710.0060.0690.005
Nullify−0.032−0.082−0.065−0.058
PvZ−0.038−0.0230.0140.010
Snake0.0220.0220.0090.009
Tetris−0.048−0.0210.0100.004
Trust−0.014−0.003−0.0010.006

Table 6 · judgment–improvement coupling。所有总体耦合都接近 0;Minesweeper 的 \(A\) 关系略正,但 calibration 关系几乎没有。论文还报告 run-level Agreement 与 NABA 的 Pearson \(r=-0.23\)、Spearman \(\rho=-0.11\)。

\[\mathrm{NABA}=\frac{\mathrm{AUC}^{+}}{\max(y_0,\varepsilon)}\]

当初始分数 \(y_0=0\) 时,\(\varepsilon\) 取该游戏第一个非零分数尺度。NABA 解决不同 baseline 的相对尺度问题,但仍然是相关性诊断,不提供 self-judging 对下一轮增益的因果证明。

RQ3:摘要记忆能否形成可执行的迭代方向?

Summary Memory 不只是把历史缩短,而是要求模型回答三个问题:哪些低分行为应被抑制,哪些高分行为应被保留,以及如何把它们压缩成下一次能执行的策略。论文用归一化高于 baseline 的面积差来比较摘要与 raw History ICL。

\[\Delta\mathrm{NABA}=\mathrm{NABA}_{\mathrm{Summary}}-\mathrm{NABA}_{\mathrm{History}}\]

正值表示摘要组织经验后,持续改善轨迹更好;每一对都使用同一个模型与同一个游戏,只改变跨 episode 历史的组织方式。这个比较不能单独证明摘要的因果优势,但能把“摘要到底保留了什么”暴露出来。

GamePairsSummary winsHistory winsTiesMean \(\Delta\)NABA解读
Chess73313.37两种路径势均力敌
Minesweeper7340−1.12局部状态细节更重要
Nullify74212.79可压缩为算术规划规则
PvZ7340−2.11依赖 lane timing 与资源状态
Snake7340−0.81精确几何不易摘要化
Tetris75116.20稳定表面与 look-ahead 可复用
Trust Evolution74308.43对手策略可被抽象

Table 7 · Summary Memory versus direct-history ICL。来源:arXiv §6.3。这里的 wins 由每个 model–game pair 的 NABA 比较得到,Mean \(\Delta\)NABA 是该游戏七个 pair 的平均。

摘要更有效

Nullify · Tetris · Trust

这些任务允许把轨迹压缩成稳定策略:向后规划 exact cancellation、保持低而无洞的 board surface、根据 payoff 推断 opponent strategy。

原历史更有效

Minesweeper · PvZ · Snake

成功依赖当前局面的局部约束、lane timing、hazard position 或身体几何;摘要保留高层目标,却可能丢掉执行所需的状态条件。

条件性结论

不是压缩越多越好

摘要的价值取决于经验能否被写成“在什么状态下执行什么动作”的因果规则,而不是文字是否更短。

四个成功摘要:经验变成规则

GPT-5.5 / Trust Evolution

方向:当 payoff 结构持续偏向 defect 时直接 defect,停止无必要的 reciprocal exploration。

证据:首个决策选择 cheat,环境 reward 为 3.0。

结果:\(\Delta\mathrm{NABA}=+66.89\)。摘要把 payoff feedback 变成了 opponent-conditioned policy。

o3-mini / Tetris

方向:同时看当前与下一个 block,试旋转,优先 clear line,并保持低表面、避免孤洞。

证据:episode 10 清掉四行;两次选择 8 0,self-score 与 environment reward 都为 1.0。

结果:\(\Delta\mathrm{NABA}=+14.42\)。

Gemini-2.5-Flash / Minesweeper

方向:展开 zero region、标记 forced mine,只 uncover 可证明安全的格子。

证据:在部分揭示棋盘选择 flag (2,2),得到 reward 0.0625。

结果:\(\Delta\mathrm{NABA}=+25.49\)。摘要将局部约束写成可执行规则。

Gemini-3.5-Flash / Nullify

方向:向后规划 exact opposites,用 floor/ceiling 去除小数,合并后重新跟踪 index。

证据:terminal units 为 −19 与 19 时选择 0 1,reward 为 1.0。

结果:\(\Delta\mathrm{NABA}=+8.50\)。

四个失败摘要:方向合理仍不够

GPT-5.5 / PvZ

摘要:优先产 sun、早防守、用 Wall-nut 拖延并覆盖受威胁 lane。

结果:首步 X 1 0 reward 1.0,但 strict score 从 38.67 降到 32.33,\(\Delta\mathrm{NABA}=-2.56\)。抽象建议没有包含 lane timing、zombie position 和 sun budget。

Gemini-3.5-Flash / Chess

摘要:跟踪每个棋子的 movement rule,提交前核对坐标。

结果:低分 episode 直接输出 END,total reward 为 0,\(\Delta\mathrm{NABA}=-33.27\)。规则提醒不能解决多棋子精确定位。

GPT-4.1 / Minesweeper

摘要:从 corners 开始、展开 zero region、只标记确定 mine,无安全进展时停止。

结果:耗尽 lives 后仍选择 uncover (8,0),checkpoint score 从 0.0606 降至 0,\(\Delta\mathrm{NABA}=-22.09\)。通用启发式替代不了 constraint propagation。

GPT-4o / Snake

摘要:朝 food 移动,同时避开墙、障碍、身体和 direct reversal。

结果:在含 food、障碍与自身身体的棋盘选择 DOWN,无 reward,strict score 从 1.0 降至 0,\(\Delta\mathrm{NABA}=-22.00\)。摘要没有保留安全导航所需的精确几何。

RQ3 结论

有效摘要必须同时完成“识别可复用失败模式”和“给出足够精确的执行条件”。因此 Summary Memory 是 selective improvement mechanism:当经验存在紧凑的因果抽象时,它能去除冗余;当成功依赖当前 state-rich trajectory 时,raw history 反而更安全。

证据分层:论文证明了什么?

Paper Verified

直接由实验支持

七个 text-based game 使用可执行 verifier;探索与严格评估使用 disjoint seeds/configurations;评估轨迹不回流;History、Summary、Training 三路径带来高度不一致的结果;Self-Judging 的 step-level Agreement 与 NABA 的总体耦合接近零;Qwen3-8B 的 Trust Evolution 参数训练上升、PvZ 持续下降。

Author Claim

作者的解释性主张

摘要在 Nullify、Tetris、Trust 上更容易保留稳定策略;局部状态依赖任务更需要 raw history;失败可能来自过拟合、探索/评估错配或不可靠 self-judging。这些解释与案例一致,但并未由单独控制实验逐一证成。

Our Interpretation

我认为最重要的区分

“知道某一步看起来有正收益”是 local event prediction;“知道什么规则在未来状态下仍适用”是 state abstraction 与 transfer。S³Gym 的负耦合结果说明前者不能被当作后者的代理指标。

Research Extension

下一步可测试的方向

让 summary 同时携带触发条件、反例和置信度;用 verifier reward 做 counterfactual replay;学习何时读取 raw history、何时读取摘要;对 parameter update 加 rollback 与 held-out safety gate;把 step-level self-score 校准成可用于筛选经验的 uncertainty。

三篇工作的系统位置

工作官方项目页中的层它回答的问题与 S³Gym 的关系
Aspire / TARGETTask从 vague goal 发现并追求更高目标关注目标层面的自我进化;S³Gym 提供 experience 层的可审计接口
S³Gym / EXPERIENCEExperience自测、自判如何转化成下一轮行为本文主体:比较 history、memory、parameter training
HarnessDev / SYSTEMSystemagent 能否创建并演化自己的 harness关注系统脚手架;S³Gym 刻意固定 harness 以隔离经验转化
边界

三篇在官方项目页被组织成 Task / Experience / System 三层,但这不是 S³Gym 本文实验中的联合系统。不能把 Aspire 或 HarnessDev 的结果移植成 S³Gym 的证据,也不能把 S³Gym 的经验循环宣称为完整的自我开发 agent。

MathJax 公式安全抽查

页面统一采用 MathJax 3;比较符号使用 \lt\gt,星号使用 \ast,避免浏览器先解析 HTML。以下是项目验收要求中的代表性 smoke examples:

\(I^{\ast}\) · \(z^{\ast}_{\mathrm{img}}\) · \(z^{\mathrm{img}}_{1:I}\) · \(z_{\lt t}\) · \(P_{\theta}(\mathbf{z}\mid\mathbf{x})\) · \(\beta_1=0.9,\ \beta_2=0.95\)
\[P_{\theta}(\mathbf{z}\mid\mathbf{x})=\prod_{t=1}^{T}p_{\theta}(z_t\mid z_{\lt t},\mathbf{x})\]
\[d_t=\mathrm{LPIPS}(R_t,I^{\ast})\]

Reviewer commentary

Strength

把“学习”拆开

Self-Testing、Self-Judging、Self-Improvement 被记录成不同可观测环节,外部 verifier 与 hidden reward 让模型自述不再是唯一证据。

Strength

评估协议克制

宽松探索、严格 held-out 配置、disjoint seeds 和不回流的 eval data,明显减少了把记忆泄漏误报成泛化的风险。

Strength

失败也有信息

主表没有只展示赢家;Summary/History 的反例、Self-Judging calibration 和参数训练负迁移共同说明“经验进入系统”本身可能有害。

需要谨慎的地方

问题技术含义对结论的影响
环境覆盖面七个任务都是 text game;真实 agent 的工具调用、开放世界和长上下文协作未被覆盖。结论更准确地说是“规则可验证交互中的经验转化”,不能直接推广到通用 agent。
模型与成本主结果依赖 proprietary APIs;每个 model–game–pathway 有大量多轮调用,报告缺少完整成本与 latency 分解。公平性、预算敏感性、不同 temperature/采样策略下的稳定性仍不清楚。
训练实验单点参数更新主要展示 Qwen3-8B 一组 20-checkpoint 轨迹,未公开 optimizer、learning rate、batch、硬件、过滤脚本和训练代码。不能据此判断 parameter training 的一般能力,尤其不能把 PvZ 负迁移归因于单一机制。
统计解释耦合指标和 wins/means 是相关性、聚合结果;绝大多数 step reward 为 0 也会抬高二值 Agreement。Self-Judging 不可靠的诊断很有价值,但“导致/阻止提升”的因果关系尚未建立。
复现缺口附录给出 prompt contract 的转录路径,却没有随 arXiv 资料提供可克隆环境仓库、seed 清单或完整 API 配置。可复现协议思想,暂时难以逐字逐环境复跑数字。

Paper vs. Implementation

项目论文明确写了什么当前一手资料能否核验
交互协议模型输出 Answer: ACTION, Score: SELF-SCORE,终止时输出 END可由 Appendix A 的 prompt 转录核验。
环境与 verifier七个游戏有宽松 exploration 与严格 evaluation 配置。配置表可核验;环境源码、精确 seed 与内部 verifier 实现未随论文公开。
Summary Memorystep 0 独立 compression,抽取 session-cached Tips,当前 episode raw history 仍保留。接口与数据流可核验;原始 prompt.py 文件本身不在公开 TeX source 内。
Parameter TrainingQwen3-8B 20 checkpoints,使用 exploration trajectories 更新并在无 memory 条件下评估。曲线、epoch 与分数可核验;训练脚本与超参数不完整。
后续实验建议

最有价值的补充不是再加一个大模型,而是做可控对照:相同 trajectory 下替换 oracle judge / noisy judge / calibrated judge;相同 summary 下加入 state trigger 与反例;对参数更新做 replay、forgetting、rollback 和跨 game transfer 测试。这样才能把“经验质量”“判断质量”“更新机制”真正拆成因果因素。

审稿结论:S³Gym 是一个有用的 measurement protocol 和 failure taxonomy,尤其适合检验 agent 是否把交互日志转成可迁移的行为规则。它的贡献强在问题拆解与评估边界,弱在公开实现、统计功效与开放世界外推。把它读成“self-improvement 已被解决”会过度解读;把它读成“self-improvement 可被逐环节审计”则是论文最稳固的价值。

References & provenance

  1. Shi et al., “S³Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?”, arXiv:2608.31100v1, 2026-08-31。记录与作者
  2. 论文 HTML 版,含正文公式、Table 1–7、Figure captions 与 Appendix A。arXiv HTML
  3. 论文原始 PDF,用于核对图、表和版式语境。arXiv PDF
  4. 论文 TeX source,包含 sections/approach.texexperiments.texanalysis.texappendix.tex 与图像资源。arXiv source
  5. Self-Developing Agents 官方项目页:TARGET / EXPERIENCE / SYSTEM 三层总览。official project page
  6. 本文使用的原始概念图 Figure 1。intro.png
  7. 本文使用的方法概览 Figure 2。overview.png