一句话结论
S³Gym 的关键贡献不是提出一个更强的 agent,而是把“经验是否变成能力”做成了一个有外部 verifier、分离探索/评估、可以诊断失败来源的 benchmark。
七个 text-based、规则可执行验证的游戏,覆盖隐规则归纳、约束满足、数值变换、空间规划、资源分配、生存和多智能体策略。
同一类探索经验分别通过 raw History ICL、Summary Memory、parameter Training 进入下一轮行为。
事件 Agreement 与下一评估增益的总体相关系数 \(\rho(A,g)\) 接近零;校准误差相关也仅 −0.018。
Qwen3-8B 参数训练在 PvZ 上从初始 23 降到每个更新 checkpoint 的 6;Trust Evolution 则从 0 上升到最高 30。
S³Gym 证明的是“经验到行为的转化可以被测量,且偶尔成功”,不是“自我评价可靠”或“自我改进已经普遍实现”。最有解释力的结论是:局部地识别一个好动作,和把它抽象成跨状态可执行的策略,是两个不同难度的能力。
论文身份与资料状态
| 项目 | 核验结果 | 一手来源 |
|---|---|---|
| 准确题名 | S³Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? | arXiv record |
| 版本与日期 | v1,提交于 2026-08-31 17:05:41 UTC;当前记录为 arXiv preprint | Submission history |
| 领域 | Computer Science > Computation and Language(cs.CL) | arXiv HTML |
| 作者与机构 | Jiajun Shi, Siyuan Tao, Yuhao Wu, Zexuan Wang, Jingyuan Zhang, Jiaheng Liu, Xinping Lei, Xinrong Zhang, Siyuan Fang, Zhewen Tan, Tianle Cai, Junhao Fang, Jiameng Huang, Yueyang Wang, Jinkai Liu, Yuxuan Zhang, Jian Yang, Zhoujun Li, Shen Yan, Wenhao Huang, Ge Zhang;affiliations 为 ByteDance Seed、M-A-P、TokenWave.AI | arXiv authors · Contributions |
| 官方项目页 | Self-Developing Agents 系列主页把三篇工作对应为 TARGET / EXPERIENCE / SYSTEM 三个问题;S³Gym 位于 EXPERIENCE。 | Project page |
| 代码状态 | 论文附录说明提示模板来自 test/S3GYM/envs/*/prompt.py,但 arXiv 页面和官方项目页没有列出可直接克隆的代码仓库链接;环境实现、API 调用配置和训练脚本未随本文一同公开。 | Appendix A |
| venue 状态 | 来源明确支持 arXiv v1 与 cs.CL;未在论文一手资料中核验到会议接收信息,因此不把它写成 conference paper。 | 源记录 |
下面的配置、数字和 prompt 结构尽量直接来自 PDF/TeX/Appendix。未公开的 optimizer、API temperature、完整 system prompt 内容、环境源码、随机种子清单和参数训练数据构建脚本,不会被自行补全为论文事实。
动机:固定策略分数看不出“学会了”
传统 agent benchmark 通常给定任务、奖励、执行脚手架和评估集,然后把模型当作固定 policy 测一次。它回答的是“模型现在有多强”,却不回答“模型是否能利用自己刚才做过的事”。现实中的 agent 则不断经历观察、推理、行动和反馈,留下大量 trajectory;如果这些轨迹不能改变后续决策,经验只是日志,不是学习。
产生有信息量的证据
主动尝试策略、探索状态、观察部分可见后果,不能只等待一次最终分数。
解释发生了什么
对动作的即时价值、自身失败和潜在可复用性作判断。这里的 score 旨在预测规则下动作会得到的 immediate reward,而不是泛化的主观置信度。
改变下一次行为
将判断沉淀为 raw history、外部 memory 或参数更新,并在新配置上真的获得更高表现。
研究缺口
已有 interactive benchmark 有丰富的多轮轨迹,但多半只把轨迹用于打分或失败分析;Reflexion、Voyager、STaR、ReST 等工作展示了经验/自生成监督可以促进改进,却往往绑定单一的改善机制,使得“经验没信息”“自判错了”“更新机制不会迁移”三种失败来源难以区分。S³Gym 试图在相同的环境、种子、预算和严格评估下比较三条经验整合路径,并把模型自判与环境 verifier 的信号同时记录下来。

论文将问题限定在可执行的 text games:多轮交互、部分可观测、延迟后果和长时程决策提供“经验”,规则 verifier 提供客观的 step-level / terminal score。这样既能模拟经验积累,又能避免人工评审成为唯一裁判。
问题定义与数学骨架
每个游戏由许多独立 episode 组成。一个 episode 是一段交互 trajectory;模型同时输出动作与对“该动作即时奖励”的自判分数,环境则悄悄保存 verifier 的真实 step reward。关键是 \(s_{x,i}\) 不等同于 confidence,\(r_{x,i}\) 在主探索设置中不返回给 agent。
| 符号 | 含义 | 所在层 |
|---|---|---|
| \(x\) | episode 索引 | 数据组织 |
| \(i\) | episode 内 step 索引 | 交互时序 |
| \(c_x,\operatorname{seed}_x\) | 第 \(x\) 个 episode 的 game configuration 与随机种子 | 环境初始化 |
| \(O_{x,i}\) | 当前 text observation / board state | agent 输入 |
| \(H_{x,i}\) | 当前 episode 的已发生交互历史 | agent 输入 |
| \(a_{x,i}\) | 坐标、方向、落子或策略选择等动作 | agent 输出 |
| \(s_{x,i}\) | agent 对动作即时奖励的 self-judged score | 内部判断 |
| \(F_{x,i}\) | 环境返回、可继续用于交互的 observable feedback | 环境反馈 |
| \(r_{x,i}\) | 环境 verifier 计算的 step-level ground truth reward | 外部审计 |
| \(d_{x,i}\) | 终止信号 | 环境控制 |
| \(y_x\) | 完整 trajectory 的 final environment score | 评估指标 |
| \(\theta_t,Z_t^{(p)}\) | 第 \(t\) 轮模型参数与路径 \(p\) 的经验状态 | 跨 episode 记忆/更新 |
一个 self-improvement cycle
这里 \(t\) 是 cycle index,\(p\in\{\mathrm{History},\mathrm{Memory},\mathrm{Training}\}\) 是经验进入未来行为的路径。公式是一个 schedule:它并不假设三个 \(p\) 会同样有效,只保证每条路径共享探索与严格评估的外部条件。
交互一步发生什么
episode 从配置与 seed 重置,初始 history 为空。下一步模型接收当前观察、episode 内历史,以及此前 cycle 的路径特定经验:
环境执行提议动作并返回下一观察、可见反馈、隐藏于 agent 的 verifier reward 和终止位:
进入下一步时,agent 能看到的是带有自己分数的格式化 transition:
其中 \(\oplus\) 表示有序拼接;\(r_{x,i}\) 留在 benchmark 侧,因此评估可以在不泄露答案的情况下比较 \(s\) 与 \(r\)。episode 结束或达到步数上限后:
\(r_{x,i}\) 用来审计 Self-Judging,\(y_x\) 用来衡量严格条件下的完整行为。二者都不作为主探索阶段直接返回给模型。
如果把 verifier reward 在探索时直接反馈给 agent,模型就可能依赖一个外部老师,而不是暴露自身 self-judgment。S³Gym 的判断可靠性分析正是建立在“模型说的 \(s\)”和“环境实际的 \(r\)”被并行记录但交互时隔离之上。
完整方法:同样的经验,三种持久化方式
探索配置相对宽松,评估配置更严格;每隔若干探索 episode 做一次更新与 held-out eval。方法图中最容易忽略的一点是:Evaluation trajectory 永远不回流到 history、memory 或 training data,且探索与评估使用 disjoint seeds。

把 benchmark 看作“经验转移实验”,而不是一次性游戏 leaderboard。
路径 A · History ICL
把带 score 的探索轨迹直接序列化并追加到未来 context。优点是证据细节完整,缺点是 context budget 会成为瓶颈,也让模型自己从长轨迹中定位因果信息。
路径 B · Summary Memory
将 trajectory 压缩成“保留哪些策略、避免哪些错误、下一轮怎么做”。它更节省上下文,却引入强信息瓶颈:摘要必须足够具体,才能从描述性的经验变成新状态上的 action rule。
路径 C · Parameter Training
高分动作可作为正例;低分动作被过滤或替换成 corrected action,组成 supervised fine-tuning 数据。它具有最强的持久性,也最可能把错误判断、探索偏差或宽松配置过拟合进参数。论文将这一项作为 auxiliary pathway 进行独立的 Qwen3-8B 分析,而不是与七模型 context 表直接混排。
三条路径从同一 base model 出发,使用同一 exploration seeds、evaluation seeds、interaction budget 和 decoding settings;改变的是经验的组织/更新方式。
七个游戏:让“迁移”具体化
每个游戏保留任务身份,但改变 state space、失败代价、机会数量或 opponent sampling,使 evaluation 不只是重复探索。Max steps 取 game-specific horizon 与 controller cap 中更严格者。
| Game | 探索配置(较宽松) | 严格评估配置 | 最大步数 | 主要能力 |
|---|---|---|---|---|
| Chess | 15×15 board,12 pieces,7-step history | 相同规则,但 22 pieces | 5 | 隐规则/状态归纳 |
| Minesweeper | 9×9,10–20 mines,额外两条命 | 第一次踩雷即终止 | 64 | 约束满足 |
| Nullify | 3–7 construction steps | 5–10 construction steps | 50 | 数值变换/组合规划 |
| Plants-vs-Zombies | 3×7 battlefield | 5×6 battlefield | 64 | 资源分配/长时程策略 |
| Snake | 碰撞与非法动作当作 no-op | 碰撞与非法动作终止 episode | 64 | 反应式空间控制 |
| Tetris | 10×10 board | 8×8 board | 64 | 空间规划/表面管理 |
| Trust Evolution | opponent 偏向较容易策略 | opponent strategies uniform sampling | 10 | 对手建模/社会策略 |
Table 2 · 论文环境设置的可读版。探索不一定总是“更小”,核心是不改变任务问题而降低失败成本或缩小搜索难度。来源:arXiv §5.1。
Agent 看到什么、必须输出什么
| Game | 主要 observation | 合法动作形态 | score 语义 |
|---|---|---|---|
| Chess | N×N board,标记 pieces 与空格 | 一个或多个 piece 的坐标预测 | 预测正确的即时位置数/规则得分 |
| Minesweeper | 部分揭示的数字、旗帜、未知格 | uncover / flag / unflag | 正确标记 mine 的比例 |
| Nullify | 带索引的 signed values 与 operators | 选择两个 unit index | 完成抵消为 1,否则终局为 0 |
| Tetris | 固定块 board + next block | drop column + rotation angle | 本步/最终清除的行数 |
| Snake | 墙、head、body、food、obstacles、方向 | LEFT/RIGHT/UP/DOWN | 吃到 apple 等即时生存奖励 |
| PvZ | battlefield、sun、plants、zombies、turn | 零个或多个 plant placements | 每 survived turn 增加 1 |
| Trust Evolution | round 与 interaction/payoff history | collaborate / cheat | 依据 payoff matrix 的本轮收益 |
这是附录给出的 shared response contract。六个游戏共享基础交互协议,Trust Evolution 使用自己的 game-specific system instruction;memory 条件改变的是 cross-episode experience 的呈现,不改变游戏规则、动态状态、合法动作空间和 self-judging contract。
Appendix A 的 prompt 级实现要点
History ICL:上一轮保留的每一步被序列化为 Env: <STATE> 与 LLM: Answer: <ACTION>, Score: <SELF-SCORE>;当前 episode history 与当前 game prompt 完整保留,超出 context budget 时截断上一轮历史的尾部。
Summary Memory:每个 episode 的 step 0 先用 game rule + 截断的上一轮 history 做一次独立 compression call,抽取 Tips;Tips 在 session 内缓存,后续 action-time input 仍附带当前 episode 的 raw history。也就是说它只压缩跨 episode 经验,不压缩当前状态。
重要限制:TeX 源把这些 prompt 称为从 test/S3GYM/envs/*/prompt.py 转录而来,但源码包只包含论文材料,不包含这些环境文件本身。因此这里能复述接口,却不能声称已核验完整代码实现。
实验设置与可复现边界
Context-level 主实验
| Setting | 论文值 | 解释 |
|---|---|---|
| Models | GPT-4o、GPT-4.1、o3-mini、Gemini-2.5-Flash、Gemini-2.5-Pro、GPT-5.5、Gemini-3.5-Flash | 七个游戏结果完整的 proprietary LLM 才进入主表 |
| History-ICL input limit | 100,000 tokens | 上一轮 raw history 的 context 上限 |
| Output generation cap | 14,000 new tokens / response | 单次回答生成上限 |
| Controller interaction cap | 64 steps / episode | 游戏自身 horizon 更小时以游戏配置为准 |
| Exploration budget | 30 episodes | 每个 game / model / pathway 的探索上限 |
| Evaluation interval | 每 3 个 exploration episodes | checkpoint \(x\in\{0,3,6,\ldots,30\}\) |
| Evaluation set | 3 strict-mode episodes / checkpoint | 与 exploration 使用 disjoint seeds |
| Evaluation data flow | 不回流 | 评估轨迹不写入 history、memory 或 training data |
如何读三项曲线指标
令 \(y_{m,p,g,k}\) 表示 model \(m\)、pathway \(p\)、game \(g\) 在 checkpoint \(x_k\) 的严格评估分数。论文同时报告:
Avg 反映整个过程的平均能力,Max 捕捉偶然的 capability breakthrough,AUC+ 衡量高于初始 baseline 的持续面积;曲线在 checkpoint 间用 piecewise-linear interpolation。不同游戏分数尺度差异很大,所以 raw AUC+ 只能在同一游戏内部比较。
参数训练的独立分析
RQ1 使用 Qwen3-8B 的 20 个 consecutive checkpoints:epoch 0 是原始模型,epoch 1–19 是由 exploration trajectories 更新后的模型;评估时不带 History ICL 或 Summary Memory。论文公开了训练曲线与行为结果,但没有在正文/附录给出 optimizer、learning rate、batch size、epoch 内数据量、LoRA/全量更新选择、训练硬件或完整 filtering script,故这些项目在本页标记为“未报告”。
“同一 interaction budget 和 decoding settings”足以支持方法间的协议比较,但不是完整的随机性审计。proprietary model 版本、服务端采样实现、并发失败的处理以及未公开的环境代码,都会影响独立复现实验。
主结果:没有 universal memory winner
下表完整保留论文 Table 4 的 Avg、Max 与 AUC+ 数值。粗体在原论文表示对应 pathway/game 内最优;这里通过 绿色 标示同一块内的原始 best。
Avg · 全部模型与游戏
| Pathway / Model | Chess | Minesweeper | Nullify | Tetris | Snake | PvZ | Trust Evo |
|---|---|---|---|---|---|---|---|
| History ICL | |||||||
| GPT-4o | 0.007 | 0.044 | 0.030 | 0.030 | 0.212 | 11.636 | 8.242 |
| GPT-4.1 | 0.010 | 0.042 | 0.030 | 0.152 | 0.515 | 16.909 | 7.371 |
| o3-mini | 0.012 | 0.222 | 0.030 | 1.273 | 4.000 | 26.333 | 9.242 |
| Gemini-2.5-Flash | 0.009 | 0.063 | 0.030 | 0.121 | 1.424 | 20.697 | 9.008 |
| Gemini-2.5-Pro | 0.025 | 0.421 | 0.212 | 0.273 | 1.576 | 28.242 | 14.500 |
| GPT-5.5 | 0.017 | 0.604 | 0.545 | 4.242 | 9.061 | 44.033 | 7.848 |
| Gemini-3.5-Flash | 0.547 | 0.482 | 0.394 | 1.970 | 8.455 | 44.697 | 17.242 |
| Summary Memory | |||||||
| GPT-4o | 0.005 | 0.013 | 0.000 | 0.030 | 0.303 | 11.818 | 13.947 |
| GPT-4.1 | 0.010 | 0.012 | 0.030 | 0.182 | 0.545 | 14.727 | 13.371 |
| o3-mini | 0.006 | 0.425 | 0.061 | 1.788 | 6.727 | 26.424 | 7.174 |
| Gemini-2.5-Flash | 0.074 | 0.438 | 0.091 | 0.152 | 1.364 | 21.939 | 8.720 |
| Gemini-2.5-Pro | 0.110 | 0.466 | 0.182 | 0.545 | 1.273 | 19.667 | 9.568 |
| GPT-5.5 | 0.533 | 0.742 | 0.576 | 3.515 | 10.697 | 33.500 | 8.697 |
| Gemini-3.5-Flash | 0.208 | 0.603 | 0.455 | 1.091 | 10.242 | 43.879 | 14.394 |
Max · 偶然峰值与稳定能力不是一回事
| Pathway / Model | Chess | Minesweeper | Nullify | Tetris | Snake | PvZ | Trust Evo |
|---|---|---|---|---|---|---|---|
| History ICL | |||||||
| GPT-4o | 0.018 | 0.131 | 0.333 | 0.333 | 0.667 | 17.667 | 11.500 |
| GPT-4.1 | 0.018 | 0.189 | 0.333 | 0.667 | 1.667 | 21.667 | 10.250 |
| o3-mini | 0.022 | 0.500 | 0.333 | 2.667 | 9.667 | 29.333 | 13.250 |
| Gemini-2.5-Flash | 0.022 | 0.670 | 0.333 | 0.333 | 2.333 | 29.000 | 13.583 |
| Gemini-2.5-Pro | 0.089 | 0.659 | 0.667 | 1.000 | 4.333 | 33.000 | 19.000 |
| GPT-5.5 | 0.067 | 0.974 | 1.000 | 11.333 | 11.333 | 48.000 | 23.000 |
| Gemini-3.5-Flash | 0.742 | 0.705 | 1.000 | 3.000 | 13.000 | 62.667 | 21.000 |
| Summary Memory | |||||||
| GPT-4o | 0.018 | 0.033 | 0.000 | 0.333 | 1.000 | 20.333 | 19.333 |
| GPT-4.1 | 0.031 | 0.083 | 0.333 | 0.667 | 1.000 | 19.333 | 15.917 |
| o3-mini | 0.018 | 0.608 | 0.333 | 4.000 | 10.333 | 29.000 | 10.083 |
| Gemini-2.5-Flash | 0.147 | 0.665 | 0.333 | 0.667 | 2.333 | 26.333 | 13.750 |
| Gemini-2.5-Pro | 0.258 | 0.974 | 0.333 | 2.000 | 3.000 | 26.667 | 14.333 |
| GPT-5.5 | 0.773 | 1.000 | 1.000 | 6.667 | 14.000 | 41.333 | 17.000 |
| Gemini-3.5-Flash | 0.524 | 0.961 | 1.000 | 2.333 | 12.000 | 51.667 | 20.333 |
AUC+ · 持续高于 baseline 的面积
| Pathway / Model | Chess | Minesweeper | Nullify | Tetris | Snake | PvZ | Trust Evo |
|---|---|---|---|---|---|---|---|
| History ICL | |||||||
| GPT-4o | 0.233 | 1.437 | 0.500 | 1.000 | 0.000 | 0.052 | 3.443 |
| GPT-4.1 | 0.186 | 1.329 | 1.000 | 0.000 | 8.501 | 129.000 | 5.966 |
| o3-mini | 0.004 | 0.000 | 1.000 | 0.000 | 0.000 | 5.383 | 62.638 |
| Gemini-2.5-Flash | 0.017 | 0.000 | 1.000 | 0.000 | 7.317 | 24.402 | 6.251 |
| Gemini-2.5-Pro | 0.000 | 3.539 | 1.500 | 0.000 | 0.000 | 60.416 | 161.876 |
| GPT-5.5 | 0.474 | 0.959 | 1.000 | 96.251 | 0.163 | 548.499 | 164.411 |
| Gemini-3.5-Flash | 12.280 | 1.217 | 0.417 | 34.000 | 37.387 | 161.945 | 200.000 |
| Summary Memory | |||||||
| GPT-4o | 0.007 | 0.046 | 0.000 | 0.500 | 1.917 | 12.778 | 10.350 |
| GPT-4.1 | 0.177 | 0.046 | 1.000 | 0.000 | 0.000 | 75.462 | 154.876 |
| o3-mini | 0.079 | 0.001 | 2.000 | 28.598 | 0.300 | 40.425 | 30.521 |
| Gemini-2.5-Flash | 2.147 | 7.794 | 3.000 | 0.500 | 0.000 | 238.501 | 18.443 |
| Gemini-2.5-Pro | 0.573 | 0.721 | 0.000 | 10.084 | 11.321 | 11.872 | 10.624 |
| GPT-5.5 | 16.840 | 2.951 | 7.418 | 50.801 | 0.000 | 33.219 | 240.500 |
| Gemini-3.5-Flash | 0.000 | 0.793 | 5.584 | 15.808 | 0.750 | 123.535 | 55.095 |
Table 4 · 主结果。明确标记的 concurrency failures 被排除;AUC+ 按 checkpoint 间梯形积分。完整原表:arXiv §5.3。
不要把 AUC+ 横跨游戏平均。PvZ 的原始数值天然比 Chess 大很多;“谁赢”必须限定在同一个 game、同一指标、同一 pathway 内。Max 变大但 Avg/AUC+ 不变,往往只是一次成功而非稳定改进。
绿色条表示 Summary Memory 方向的相对改善示例,蓝色条表示摘要后明显下降;条形只用于阅读提示,不把不同游戏的绝对尺度混在一起。
RQ1:参数训练能否把经验内化?
Qwen3-8B 的训练实验把 memory 从 inference context 中拿走,只保留由 exploration trajectories 和 self-judgments 构成的参数更新。它回答的是更强的持久性问题:如果未来没有历史轨迹,模型是否还能表现得更好?
最高分 30,19 个更新 checkpoint 中有 18 个高于初始 baseline;post-training Avg 为 8.684,AUC+ 为 163.5。
初始分数 23,所有更新 checkpoint 都是 6,持续负迁移;论文只列出可能原因,没有证明是哪一个。
Chess 只在 final 达到 0.0667;Snake 在 epoch 8、12、15 达到 1 后又回到 0;Minesweeper、Nullify、Tetris 全程为 0。
pics/trends/train_qwen3_8b_direct.pdf,可从 PDF 查看。PvZ 的持续下降可能来自对宽松探索轨迹的过拟合、探索/严格评估的配置错配,或不可靠 Self-Judging;当前实验只建立了“参数更新可能覆盖原本有效行为”的事实,不能从曲线判定具体机制。
RQ2:模型的 Self-Judging 可靠吗?
每个 transition 同时保留模型的 \(s_i\) 与环境的 \(r_i\)。论文统计七个模型、七个游戏、两种 context pathway,共 98 runs、116,117 transitions。它使用四类信号:正/非正事件 Agreement、归一化数值误差 NMAE、over-confidence 和 under-confidence。
Agreement 只问“模型与 verifier 是否都认为这一步有正收益”,不问收益有多大。由于不同游戏 reward scale 不同,论文再用 game-level min–max normalization 计算:
此外,over-confidence 是 \(\Pr(s_i\gt 0,r_i\leq 0)\),under-confidence 是 \(\Pr(s_i\leq 0,r_i\gt 0)\)。高 Agreement 可能只是因为绝大多数 transition 的真实 reward 都是 0,因此必须和 NMAE 一起读。
| Game | Agreement ↑ | NMAE ↓ | Over-conf. ↓ | Under-conf. ↓ | 阅读 |
|---|---|---|---|---|---|
| Chess | 0.496 | 0.141 | 0.365 | 0.139 | 事件判断接近随机,过度自信最高 |
| Minesweeper | 0.820 | 0.524 | 0.062 | 0.118 | 事件 Agreement 高,但数值校准弱 |
| Nullify | 0.827 | 0.056 | 0.170 | 0.004 | 数值校准较好 |
| PvZ | 0.881 | 0.882 | 0.032 | 0.087 | Agreement 最高但 NMAE 也最高 |
| Snake | 0.879 | 0.121 | 0.110 | 0.011 | 事件判断强,仍有局部误判 |
| Tetris | 0.846 | 0.041 | 0.151 | 0.002 | NMAE 最低,校准最好之一 |
| Trust | 0.665 | 0.392 | 0.291 | 0.044 | 隐藏对手策略导致过度自信 |
Table 5 · Self-Judging step-level reliability。来源:arXiv §6.2。
PvZ 的 Agreement 0.881 看起来很好,但 NMAE 0.882,说明模型经常知道“这一步有/没有正收益”,却严重估错收益幅度。Chess 的 Agreement 0.496 + over-confidence 0.365 则是最直接的失败案例。自判的二值正确不等于可复用的策略知识。
Judgment–improvement coupling
为检验“自判越准,下一轮越会提升”是否成立,论文把相邻评估 checkpoint 间的探索 episode 分成 block \(B_t\),计算 block 的 agreement \(A_t\)、calibration error \(E_t\),以及随后严格评估的归一化增益:
再比较 \(\rho(A_t,g_t)\)、\(\rho(-E_t,g_t)\) 和高/低判断质量 tertile 的 gain gap。
| Game | \(\rho(A,g)\) | \(\rho(-E,g)\) | GapA | GapE |
|---|---|---|---|---|
| All | −0.010 | −0.018 | −0.004 | −0.016 |
| Chess | −0.014 | −0.058 | 0.028 | −0.039 |
| Minesweeper | 0.071 | 0.006 | 0.069 | 0.005 |
| Nullify | −0.032 | −0.082 | −0.065 | −0.058 |
| PvZ | −0.038 | −0.023 | 0.014 | 0.010 |
| Snake | 0.022 | 0.022 | 0.009 | 0.009 |
| Tetris | −0.048 | −0.021 | 0.010 | 0.004 |
| Trust | −0.014 | −0.003 | −0.001 | 0.006 |
Table 6 · judgment–improvement coupling。所有总体耦合都接近 0;Minesweeper 的 \(A\) 关系略正,但 calibration 关系几乎没有。论文还报告 run-level Agreement 与 NABA 的 Pearson \(r=-0.23\)、Spearman \(\rho=-0.11\)。
当初始分数 \(y_0=0\) 时,\(\varepsilon\) 取该游戏第一个非零分数尺度。NABA 解决不同 baseline 的相对尺度问题,但仍然是相关性诊断,不提供 self-judging 对下一轮增益的因果证明。
RQ3:摘要记忆能否形成可执行的迭代方向?
Summary Memory 不只是把历史缩短,而是要求模型回答三个问题:哪些低分行为应被抑制,哪些高分行为应被保留,以及如何把它们压缩成下一次能执行的策略。论文用归一化高于 baseline 的面积差来比较摘要与 raw History ICL。
正值表示摘要组织经验后,持续改善轨迹更好;每一对都使用同一个模型与同一个游戏,只改变跨 episode 历史的组织方式。这个比较不能单独证明摘要的因果优势,但能把“摘要到底保留了什么”暴露出来。
| Game | Pairs | Summary wins | History wins | Ties | Mean \(\Delta\)NABA | 解读 |
|---|---|---|---|---|---|---|
| Chess | 7 | 3 | 3 | 1 | 3.37 | 两种路径势均力敌 |
| Minesweeper | 7 | 3 | 4 | 0 | −1.12 | 局部状态细节更重要 |
| Nullify | 7 | 4 | 2 | 1 | 2.79 | 可压缩为算术规划规则 |
| PvZ | 7 | 3 | 4 | 0 | −2.11 | 依赖 lane timing 与资源状态 |
| Snake | 7 | 3 | 4 | 0 | −0.81 | 精确几何不易摘要化 |
| Tetris | 7 | 5 | 1 | 1 | 6.20 | 稳定表面与 look-ahead 可复用 |
| Trust Evolution | 7 | 4 | 3 | 0 | 8.43 | 对手策略可被抽象 |
Table 7 · Summary Memory versus direct-history ICL。来源:arXiv §6.3。这里的 wins 由每个 model–game pair 的 NABA 比较得到,Mean \(\Delta\)NABA 是该游戏七个 pair 的平均。
Nullify · Tetris · Trust
这些任务允许把轨迹压缩成稳定策略:向后规划 exact cancellation、保持低而无洞的 board surface、根据 payoff 推断 opponent strategy。
Minesweeper · PvZ · Snake
成功依赖当前局面的局部约束、lane timing、hazard position 或身体几何;摘要保留高层目标,却可能丢掉执行所需的状态条件。
不是压缩越多越好
摘要的价值取决于经验能否被写成“在什么状态下执行什么动作”的因果规则,而不是文字是否更短。
四个成功摘要:经验变成规则
GPT-5.5 / Trust Evolution
方向:当 payoff 结构持续偏向 defect 时直接 defect,停止无必要的 reciprocal exploration。
证据:首个决策选择 cheat,环境 reward 为 3.0。
结果:\(\Delta\mathrm{NABA}=+66.89\)。摘要把 payoff feedback 变成了 opponent-conditioned policy。
o3-mini / Tetris
方向:同时看当前与下一个 block,试旋转,优先 clear line,并保持低表面、避免孤洞。
证据:episode 10 清掉四行;两次选择 8 0,self-score 与 environment reward 都为 1.0。
结果:\(\Delta\mathrm{NABA}=+14.42\)。
Gemini-2.5-Flash / Minesweeper
方向:展开 zero region、标记 forced mine,只 uncover 可证明安全的格子。
证据:在部分揭示棋盘选择 flag (2,2),得到 reward 0.0625。
结果:\(\Delta\mathrm{NABA}=+25.49\)。摘要将局部约束写成可执行规则。
Gemini-3.5-Flash / Nullify
方向:向后规划 exact opposites,用 floor/ceiling 去除小数,合并后重新跟踪 index。
证据:terminal units 为 −19 与 19 时选择 0 1,reward 为 1.0。
结果:\(\Delta\mathrm{NABA}=+8.50\)。
四个失败摘要:方向合理仍不够
GPT-5.5 / PvZ
摘要:优先产 sun、早防守、用 Wall-nut 拖延并覆盖受威胁 lane。
结果:首步 X 1 0 reward 1.0,但 strict score 从 38.67 降到 32.33,\(\Delta\mathrm{NABA}=-2.56\)。抽象建议没有包含 lane timing、zombie position 和 sun budget。
Gemini-3.5-Flash / Chess
摘要:跟踪每个棋子的 movement rule,提交前核对坐标。
结果:低分 episode 直接输出 END,total reward 为 0,\(\Delta\mathrm{NABA}=-33.27\)。规则提醒不能解决多棋子精确定位。
GPT-4.1 / Minesweeper
摘要:从 corners 开始、展开 zero region、只标记确定 mine,无安全进展时停止。
结果:耗尽 lives 后仍选择 uncover (8,0),checkpoint score 从 0.0606 降至 0,\(\Delta\mathrm{NABA}=-22.09\)。通用启发式替代不了 constraint propagation。
GPT-4o / Snake
摘要:朝 food 移动,同时避开墙、障碍、身体和 direct reversal。
结果:在含 food、障碍与自身身体的棋盘选择 DOWN,无 reward,strict score 从 1.0 降至 0,\(\Delta\mathrm{NABA}=-22.00\)。摘要没有保留安全导航所需的精确几何。
有效摘要必须同时完成“识别可复用失败模式”和“给出足够精确的执行条件”。因此 Summary Memory 是 selective improvement mechanism:当经验存在紧凑的因果抽象时,它能去除冗余;当成功依赖当前 state-rich trajectory 时,raw history 反而更安全。
证据分层:论文证明了什么?
直接由实验支持
七个 text-based game 使用可执行 verifier;探索与严格评估使用 disjoint seeds/configurations;评估轨迹不回流;History、Summary、Training 三路径带来高度不一致的结果;Self-Judging 的 step-level Agreement 与 NABA 的总体耦合接近零;Qwen3-8B 的 Trust Evolution 参数训练上升、PvZ 持续下降。
作者的解释性主张
摘要在 Nullify、Tetris、Trust 上更容易保留稳定策略;局部状态依赖任务更需要 raw history;失败可能来自过拟合、探索/评估错配或不可靠 self-judging。这些解释与案例一致,但并未由单独控制实验逐一证成。
我认为最重要的区分
“知道某一步看起来有正收益”是 local event prediction;“知道什么规则在未来状态下仍适用”是 state abstraction 与 transfer。S³Gym 的负耦合结果说明前者不能被当作后者的代理指标。
下一步可测试的方向
让 summary 同时携带触发条件、反例和置信度;用 verifier reward 做 counterfactual replay;学习何时读取 raw history、何时读取摘要;对 parameter update 加 rollback 与 held-out safety gate;把 step-level self-score 校准成可用于筛选经验的 uncertainty。
三篇工作的系统位置
| 工作 | 官方项目页中的层 | 它回答的问题 | 与 S³Gym 的关系 |
|---|---|---|---|
| Aspire / TARGET | Task | 从 vague goal 发现并追求更高目标 | 关注目标层面的自我进化;S³Gym 提供 experience 层的可审计接口 |
| S³Gym / EXPERIENCE | Experience | 自测、自判如何转化成下一轮行为 | 本文主体:比较 history、memory、parameter training |
| HarnessDev / SYSTEM | System | agent 能否创建并演化自己的 harness | 关注系统脚手架;S³Gym 刻意固定 harness 以隔离经验转化 |
三篇在官方项目页被组织成 Task / Experience / System 三层,但这不是 S³Gym 本文实验中的联合系统。不能把 Aspire 或 HarnessDev 的结果移植成 S³Gym 的证据,也不能把 S³Gym 的经验循环宣称为完整的自我开发 agent。
MathJax 公式安全抽查
页面统一采用 MathJax 3;比较符号使用 \lt、\gt,星号使用 \ast,避免浏览器先解析 HTML。以下是项目验收要求中的代表性 smoke examples:
Reviewer commentary
把“学习”拆开
Self-Testing、Self-Judging、Self-Improvement 被记录成不同可观测环节,外部 verifier 与 hidden reward 让模型自述不再是唯一证据。
评估协议克制
宽松探索、严格 held-out 配置、disjoint seeds 和不回流的 eval data,明显减少了把记忆泄漏误报成泛化的风险。
失败也有信息
主表没有只展示赢家;Summary/History 的反例、Self-Judging calibration 和参数训练负迁移共同说明“经验进入系统”本身可能有害。
需要谨慎的地方
| 问题 | 技术含义 | 对结论的影响 |
|---|---|---|
| 环境覆盖面 | 七个任务都是 text game;真实 agent 的工具调用、开放世界和长上下文协作未被覆盖。 | 结论更准确地说是“规则可验证交互中的经验转化”,不能直接推广到通用 agent。 |
| 模型与成本 | 主结果依赖 proprietary APIs;每个 model–game–pathway 有大量多轮调用,报告缺少完整成本与 latency 分解。 | 公平性、预算敏感性、不同 temperature/采样策略下的稳定性仍不清楚。 |
| 训练实验单点 | 参数更新主要展示 Qwen3-8B 一组 20-checkpoint 轨迹,未公开 optimizer、learning rate、batch、硬件、过滤脚本和训练代码。 | 不能据此判断 parameter training 的一般能力,尤其不能把 PvZ 负迁移归因于单一机制。 |
| 统计解释 | 耦合指标和 wins/means 是相关性、聚合结果;绝大多数 step reward 为 0 也会抬高二值 Agreement。 | Self-Judging 不可靠的诊断很有价值,但“导致/阻止提升”的因果关系尚未建立。 |
| 复现缺口 | 附录给出 prompt contract 的转录路径,却没有随 arXiv 资料提供可克隆环境仓库、seed 清单或完整 API 配置。 | 可复现协议思想,暂时难以逐字逐环境复跑数字。 |
Paper vs. Implementation
| 项目 | 论文明确写了什么 | 当前一手资料能否核验 |
|---|---|---|
| 交互协议 | 模型输出 Answer: ACTION, Score: SELF-SCORE,终止时输出 END。 | 可由 Appendix A 的 prompt 转录核验。 |
| 环境与 verifier | 七个游戏有宽松 exploration 与严格 evaluation 配置。 | 配置表可核验;环境源码、精确 seed 与内部 verifier 实现未随论文公开。 |
| Summary Memory | step 0 独立 compression,抽取 session-cached Tips,当前 episode raw history 仍保留。 | 接口与数据流可核验;原始 prompt.py 文件本身不在公开 TeX source 内。 |
| Parameter Training | Qwen3-8B 20 checkpoints,使用 exploration trajectories 更新并在无 memory 条件下评估。 | 曲线、epoch 与分数可核验;训练脚本与超参数不完整。 |
最有价值的补充不是再加一个大模型,而是做可控对照:相同 trajectory 下替换 oracle judge / noisy judge / calibrated judge;相同 summary 下加入 state trigger 与反例;对参数更新做 replay、forgetting、rollback 和跨 game transfer 测试。这样才能把“经验质量”“判断质量”“更新机制”真正拆成因果因素。
审稿结论:S³Gym 是一个有用的 measurement protocol 和 failure taxonomy,尤其适合检验 agent 是否把交互日志转成可迁移的行为规则。它的贡献强在问题拆解与评估边界,弱在公开实现、统计功效与开放世界外推。把它读成“self-improvement 已被解决”会过度解读;把它读成“self-improvement 可被逐环节审计”则是论文最稳固的价值。
References & provenance
- Shi et al., “S³Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?”, arXiv:2608.31100v1, 2026-08-31。记录与作者
- 论文 HTML 版,含正文公式、Table 1–7、Figure captions 与 Appendix A。arXiv HTML
- 论文原始 PDF,用于核对图、表和版式语境。arXiv PDF
- 论文 TeX source,包含
sections/approach.tex、experiments.tex、analysis.tex、appendix.tex与图像资源。arXiv source - Self-Developing Agents 官方项目页:TARGET / EXPERIENCE / SYSTEM 三层总览。official project page
- 本文使用的原始概念图 Figure 1。intro.png
- 本文使用的方法概览 Figure 2。overview.png