论文身份核验
“Scene Graph Thinking”对应的方法名为 SaGe。原文 PDF、arXiv 条目、ICML 2026 会议列表与作者仓库共同指向同一篇论文。
PDF 首页给出 arXiv v3、完整作者名单、ICML 2026、PMLR 306 与 Seoul。官方仓库也标注 2026 年 5 月 1 日被 ICML 接收。arXiv 条目 · ICML 2026 列表 · 官方仓库
姓名拼写差异。仓库可见文本曾写作 “Yuchen Wu” 与 “Yuxcong Meng”,但 PDF 首页和仓库 BibTeX 都是 Yuanchen Wu 与 Yucong Meng。本页采用论文 PDF 与 BibTeX 的一致写法。
原始 PDF 已包含 Appendix A 至 D,共 22 页。附录公开了训练批量、学习率、训练轮数、奖励 judge、数据构成、图质量统计和两类 judge prompt。仓库当前主要提供 README 与展示图片,并明确写明代码和数据仍处于内部审查,暂未形成可直接运行的公开复现包。
一页结论
SaGe 先把平坦图文数据转换成层级场景图。节点包含实体类别、属性、边界框与深度范围,边连接空间、交互和语义关系。随后从图中采样节点问题、关系问题、多跳轨迹和全局描述,用 120K 样本进行 SFT,再用 GRPO 与节点 grounded、节点 relevance、答案准确性和格式奖励进行强化微调。
相对 Qwen2.5 VL 3B,SaGe 3B 在 VStarBench 从 75.4 提升到 89.0,在 CVBench 2D 从 67.0 提升到 77.8,在 CVBench 3D 从 66.5 提升到 72.3。主要收益集中在高分辨率细粒度感知与空间关系。
SaGe 的“scene graph thinking”不是一个可查询、可回溯、可执行的在线图模块。训练时有显式图,推理时可见的是节点标签化的语言轨迹。结构是否被模型忠实执行,主要通过输出格式与节点奖励间接验证。
最值得迁移的不是把通用场景图直接换成程序化材质图,而是把参考图像分解为可定位、可验证、可跨尺度组织的 material feature graph,再用渲染器提供闭环反馈。
问题定义与数学建模
传统图文数据被记作 \(D_{\mathrm{flat}}=\{(I_i,T_i)\}_{i=1}^{N}\),其中 \(I_i\) 是图像,\(T_i\) 是问题、指令或文本标注。SaGe 将每个样本提升为层级场景图 \(G_i=(V_i,E_i)\),并从图的拓扑中采样结构化文本:
这里的条件符号表示文本和推理轨迹由场景图约束生成,不表示推理时将完整 \(G_i\) 作为外部输入。单个节点定义为:
\(c_t\) 是实体类别,\(a_t\) 是属性,\(b_t\) 是二维边界框,\(d_t\) 是估计深度范围。采样器以场景图和全局 caption 为条件,生成问题、答案与节点轨迹:
轨迹中的每个访问节点以 <entity>、<bbox>、<depth> 标签显式表达,使类别、二维位置和粗深度同时成为可评分的过程证据。原文第 3 至 5 页
显式场景图如何构造
构图是一个离线、自动化、混合模型管线。它先扩大实体粒度,再补充深度,最后利用节点先验构边。
节点层级
主对象先被建为一级节点,其裁剪区域再次送入 MLLM 识别组件。车可以拥有车牌、车灯等子节点。这解决了细小目标在整图尺度上被忽略的问题,也为多跳导航提供了“整体到部件”的结构。
深度不是精确几何
Depth Anything 先给出像素深度,SAM 根据边界框生成掩膜,边界腐蚀后只在掩膜内统计深度范围。原文明确说明深度值是用于前后关系推理的 range cue,不是度量深度,也没有跨图标定。
边表示仍不完全可复现
论文将边概括为空间、interaction 与 semantic 三类,并强调利用节点级先验减少直接由 MLLM 猜关系的错误。但没有公开完整 relation vocabulary、边 schema、冲突消解规则、方向约定或每类构边算法,因此“显式边”在概念上清楚,在工程上仍有缺口。
120K 数据引擎
在构图之后,作者先用视觉语言模型生成全局 caption \(C_i\),再让 GPT OSS 120B 从 \(G_i\) 与 \(C_i\) 中采样节点与边。节点中心问题覆盖颜色、形状、状态、材质等属性,边中心问题覆盖二维、三维空间关系与交互。输出同时包含 question、answer 和节点式 CoT。
| 数据类型 | 样本数 | 结构信号 | 任务目标 |
|---|---|---|---|
| 属性中心 | 25K | 实体与属性 | 颜色 10K,状态 5K,形状 5K,材质 5K |
| 空间推理 | 30K | bbox 与 depth | 二维左右上下,三维前后关系 |
| 多跳轨迹 | 25K | 关系路径 | 沿边导航到目标节点 |
| caption | 20K | 局部或全图遍历 | 局部 10K,全局 10K |
| grounding | 10K | 边界框 | 目标定位 |
| counting | 10K | 实例集合 | 目标计数,来源 COCO 2014 |
两轮过滤
- 使用 GME 类视觉文本嵌入模型计算裁剪区域与节点文本的相似度,低于阈值的样本被丢弃。论文未报告阈值。
- 使用 proprietary MLLM 交叉验证问题、答案、轨迹与标注的一致性。caption 还需通过 8 项规则并获得满分。
作者随机抽取 1,000 个原始图,用 Gemini 3 Pro 评估 22,029 个节点和 26,283 条边。节点正确率为 94.5%,边正确率为 92.9%。节点错误中 52.0% 来自属性与视觉区域不匹配,边错误中 55.6% 是 invalid relation。最终训练数据经人工随机复核的 failure rate 低于 1%。
上述 94.5% 和 92.9% 是模型 judge 对构图结果的 precision 式评估,不是穷举标注下的 recall。论文也承认开放式层级节点难以完整标注,因此不能据此推断场景图覆盖了图像中的全部实体与关系。
两阶段训练与强化信号
SFT 教模型“怎样写结构化轨迹”,GRPO 再教模型“访问哪些节点,以及节点是否真的对应视觉区域”。
节点 grounded 奖励
对轨迹中的节点 \(v_t\),从 <entity> 提取描述 \(e_t\),从 <bbox> 提取区域 \(\phi(I_i,b_t)\)。多模态 judge 判断区域与实体类别及属性是否匹配:
judge 只输出 0 或 1,而且要求裁剪区域中不能有其他清晰对象。这一严格规则提高纯净 grounding,但对“手持物”“表面纹理”“整体与部件重叠”等天然复合区域可能过度惩罚。
节点 relevance 奖励
LLM judge 从问题与标准答案识别锚点集合 \(A\)。轨迹访问到锚点,或访问到被 judge 认为能为锚点提供必要语义支持的节点时,得到分级奖励 \(R\in\{1.0,0.8,0.5,0.2,0.0\}\):
完整轨迹奖励还包含答案准确性与格式奖励:
论文没有报告四项奖励的额外权重,公式等价地相加。值得注意的是 relevance 项以 \(|A|\) 归一化而非轨迹长度 \(T\),因此访问多个相关节点可能累计更高分。是否设置总分截断、是否防止重复节点获奖,公开资料未说明。
GRPO 目标
SFT 模型同时作为参考策略 \(\pi_{\mathrm{ref}}\)。每个样本生成 8 个 rollout,组内比较相对优势。论文没有报告 \(\epsilon\)、\(\beta\)、温度、最大生成长度或优化器参数。
Appendix D 的 node grounded judge prompt
要求 judge 对裁剪图与实体名进行二元匹配。只有实体名匹配、属性匹配且没有其他清晰对象时输出 1,任何一项不满足输出 0。更详细示例被作者省略。
Appendix D 的 node relevance judge prompt
先计算需 grounded 的实体总数,包括主语和提供关系支持的对象。再逐个给 extracted entities 评分:精确一致为 1.0,语义或属性相似为 0.8,主体正确但属性误用为 0.5,主体偏到容器或部件为 0.2,冲突、否定或无关为 0.0。输出严格 JSON。
训练时有图,推理时有轨迹
<answer> 中给出答案或边界框论文展示的推理轨迹类似:先识别 car 节点,再识别 on the car 的 license plate 节点,节点后附 bbox 和 depth,最后回答颜色。这个过程在语言层面模拟图遍历,但测试时未先显式构造 \(G\),也未执行可验证的边查询。
在多个 QA benchmark 上,这种节点式轨迹能提升答案准确率、空间关系和 grounding,且 Figure 5 与 Figure 9 展示了正确的多跳案例。
不能据此断言模型内部形成了忠实、完整、持久的图结构,也不能断言输出轨迹是产生答案的真实因果过程。论文没有做隐变量探针、轨迹干预、边删除、反事实路径或在线 graph consistency 测试。
实验设计
模型与训练
| 阶段 | 基础模型 | 数据量 | epoch | 学习率 | 总 batch | 其他 |
|---|---|---|---|---|---|---|
| SFT cold start | Qwen2.5 VL 3B / 7B | 120K | 1 | \(1\times10^{-5}\) | 256 | random scaling |
| GRPO | SFT checkpoint | 26K | 1 | \(1\times10^{-6}\) | 128 | 8 rollouts |
RL 数据由 2K COCO grounding、4K ChartQA 与 20K VStarBench train 样本组成。node grounded judge 使用 Qwen3 VL 30B A3B Instruct,node relevance 与 accuracy judge 使用 Qwen3 30B A3B Instruct。多项选择题按完全匹配给 0 或 1,grounding 直接以预测框和真值框的 IoU 作为 accuracy reward。
八个 benchmark
- 高分辨率细粒度感知:VStarBench、HRBench 4K、HRBench 8K。
- 二维与三维空间理解:CVBench 2D、CVBench 3D。
- 通用视觉能力:MMStar、RefCOCO、ChartQA。
VQA 使用 accuracy,grounding 使用 Acc@0.5。baseline 包括 GPT 4o、GPT 5 Mini、Gemini 2.5 Pro,Qwen2.5 VL、LLaVA OneVision、InternVL3,以及 SEAL、DyFo、Vision R1、LVR、Pixel Reasoner、DeepEyes、Thyme 等细粒度或工具式视觉推理方法。
公平性注意。不同闭源模型与工具式方法的推理预算、图像分辨率和工具调用次数没有在本论文中统一披露。最干净的比较仍是同底座 Qwen2.5 VL 与 SaGe 的差值。
定量结果与消融
| 方法 | 参数 | VStar overall | VStar attr. | VStar spatial | HRBench 4K | HRBench 8K |
|---|---|---|---|---|---|---|
| Qwen2.5 VL | 3B | 75.4 | 80.9 | 67.1 | 66.0 | 63.1 |
| SaGe | 3B | 89.0 | 86.1 | 93.4 | 72.0 | 68.9 |
| Qwen2.5 VL | 7B | 76.4 | 77.4 | 75.0 | 68.8 | 65.3 |
| SaGe | 7B | 89.0 | 85.2 | 94.7 | 76.5 | 73.4 |
| DeepEyes | 7B | 85.6 | 87.3 | 84.5 | 75.1 | 72.6 |
| 方法 | CV 2D | 2D count | 2D relation | CV 3D | 3D depth | 3D distance | MMStar | RefCOCO | ChartQA |
|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5 VL 3B | 67.0 | 62.4 | 72.6 | 66.5 | 73.6 | 59.3 | 52.2 | 86.3 | 82.2 |
| SaGe 3B | 77.8 | 67.9 | 89.9 | 72.3 | 79.2 | 65.3 | 54.4 | 89.0 | 83.8 |
| Qwen2.5 VL 7B | 73.6 | 62.4 | 84.9 | 73.3 | 79.8 | 66.7 | 60.3 | 88.1 | 85.6 |
| SaGe 7B | 79.4 | 68.0 | 93.2 | 80.5 | 88.8 | 72.2 | 62.3 | 89.8 | 87.2 |
训练阶段消融
| 条件 | SFT | GRPO | 节点代理奖励 | VStar | CV 2D | CV 3D |
|---|---|---|---|---|---|---|
| Qwen2.5 VL 3B | 75.4 | 67.0 | 66.5 | |||
| cold start | ✓ | 83.2 | 75.5 | 69.7 | ||
| vanilla GRPO | ✓ | ✓ | 85.9 | 76.2 | 69.3 | |
| SaGe | ✓ | ✓ | ✓ | 89.0 | 77.8 | 72.3 |
SFT 已贡献主要增益。vanilla GRPO 继续提高 VStar 与 CVBench 2D,但 CVBench 3D 从 69.7 轻微降至 69.3。加入节点代理奖励后,三项指标都达到最高值。
CoT 表示消融
| 轨迹形式 | entity | bbox | depth | VStar | CV 2D | CV 3D |
|---|---|---|---|---|---|---|
| answer only | 79.1 | 72.8 | 66.4 | |||
| entity | ✓ | 79.9 | 72.3 | 65.7 | ||
| entity + bbox | ✓ | ✓ | 80.6 | 75.0 | 66.1 | |
| 完整 SaGe CoT | ✓ | ✓ | ✓ | 83.2 | 75.5 | 69.7 |
只加 entity 标签会让 CVBench 2D 与 3D 下降,说明“结构化文本”本身不是充分条件。bbox 对二维关系有效,depth 对三维关系有效,组合后才形成稳定收益。
奖励消融
| 条件 | NGR | NRR | VStar | CV 2D | CV 3D |
|---|---|---|---|---|---|
| vanilla GRPO | 85.9 | 76.2 | 69.3 | ||
| 只加 NRR | ✓ | 87.1 | 76.9 | 71.5 | |
| 只加 NGR | ✓ | 85.0 | 74.6 | 67.6 | |
| NGR + NRR | ✓ | ✓ | 89.0 | 77.8 | 72.3 |
NGR 单独使用反而全面下降,论文将其归因于 reward hacking:模型可能关注视觉上显著但与问题无关的节点。NRR 决定“去哪里”,NGR 判断“看到的是否正确”,两者组合才有效。
关键 Figure 与 Table 结构化解读
| 编号 | 它验证什么 | 它没有验证什么 |
|---|---|---|
| Figure 2 | 混合管线能将实体、部件、bbox、depth 和多类关系组织为图。 | 没有公开每一步的完整 prompt、阈值与 relation schema。 |
| Figure 3 | 图可用于生成节点或边中心问题,并通过两轮自动过滤。 | 低于 1% failure rate 依赖抽样人工复核,未给样本数与置信区间。 |
| Figure 4 | SFT 与节点代理奖励构成连续两阶段训练。 | 示意图中的“图遍历”不等同于测试时存在外部图执行器。 |
| Figure 5 / 9 | 多个成功案例显示节点式 CoT 可定位细小对象、关系和图表元素。 | 定性挑选案例不能衡量轨迹忠实性和失败率。 |
| Table 3 | SFT 是最大单步增益来源,节点奖励进一步提升。 | 没有控制同量普通 CoT 数据,无法完全分离图结构与额外数据质量的作用。 |
| Table 4 | bbox 与 depth 分别给二维和三维任务带来针对性收益。 | 没有测试 mask、尺度、关系类型或可执行图 token。 |
| Table 5 | NGR 与 NRR 明显互补。 | 没有报告 judge 一致性、误判率或奖励成本。 |
复现清单与公开缺口
已经公开或明确报告
- 基础模型、SFT 和 RL 数据规模、学习率、总 batch、epoch、rollout 数。
- 120K 数据类别分布与 RL 三类数据来源。
- 节点字段、两阶段训练逻辑、奖励公式、两类 judge 模型与主要 prompt。
- 八个 benchmark、主要 baseline、定量表格和核心消融。
仍未公开或未说明
- 可运行训练、数据生成和评测代码,仓库写明仍在内部审查。
- 场景图 JSON 的完整 schema、relation vocabulary、构边规则、prompt 全文与过滤阈值。
- 图像总量、各源图池精确抽样数、去重策略、许可追踪与 train benchmark contamination 检查。
- 优化器、warmup、weight decay、图像 token 预算、最大序列长度、采样温度、GRPO 的 \(\epsilon\) 与 \(\beta\)。
- GPU 类型、数量、训练时长、显存、推理延迟、judge 调用成本。
- benchmark 具体 evaluation harness、图像预处理、解码配置与随机种子。
官方 GitHub README 链接模型与数据页面,但同时明确写明代码和数据仍在内部审查。当前仓库的文件列表只显示 README 与 sources 下的三张展示图,安装命令引用的 requirements、verl 和 ms swift 目录并未出现在公开文件树中。因而截至本页核查时,不能把“有仓库”理解为“已可复现”。
局限、失败模式与 reviewer 式锐评
最强证据
同底座对比和字段级消融很有说服力。bbox 对二维关系、depth 对三维关系的定向收益符合机制预期。奖励消融也揭示 grounded reward 单独使用会伤害性能,而 relevance reward 能约束搜索方向,这比只报告最终分数更有信息量。
主要问题
- 显式图只在数据侧成立。论文标题容易让人以为测试时有真实图推理。实际上在线输出是标签化 CoT,没有外部图存储、边约束或可执行遍历。
- 轨迹忠实性未被验证。答案正确与节点文本看似合理,不代表这些节点在因果上促成答案。需要节点删除、bbox 扰动、关系反转和轨迹重放实验。
- teacher 与 judge 依赖重。构图依赖 Qwen2.5 VL 72B,采样依赖 GPT OSS 120B,过滤和 RL 又依赖多个强 judge。训练成本、闭源过滤模型和错误相关性都未量化。
- 图评估偏 precision。节点与边正确率很高,但没有 recall。漏掉微小实体或材质关系时,现有指标可能完全看不见。
- 数据量与结构贡献未完全解耦。缺少同图像、同数量、同 teacher 但用普通 caption 或普通 CoT 的强对照。
- 边奖励被回避。作者合理指出边关系可能多义,但以节点作为 proxy 会弱化真正的关系正确性。模型访问了两个正确节点,不等于它解释对了二者关系。
可能的失败模式
- bbox 包含上下文对象时,严格 NGR 误判为 0。
- 单目深度范围在反射、透明、重复纹理与极近景材质上不稳定。
- 关系密集场景中,多条合法路径被 relevance judge 压缩为单一评分。
- 模型通过生成宽泛实体名或大框规避属性错误。
- 标签格式正确但节点重复,可能获得未披露的累计奖励。
与三条研究线的关系
| 研究线 | SaGe 的直接证据 | 可迁移部分 | 不能直接照搬 |
|---|---|---|---|
| Procedural Material Generation | 实体、部件、属性、位置和关系可组织为层级 context representation。 | 把材质拆成宏观结构、介观纹样、微观表面、通道依赖与空间关系。 | 通用场景图节点是物体,材质程序节点是运算符,两者不是同一种图。 |
| Context Optimization | flat image text 被转换为 \(G_i\),再采样更有效的监督轨迹。 | 优化的不只是 prompt 文本,而是图结构、节点粒度、空间 grounding 与检索顺序。 | SaGe 没有在测试时对每张图显式求最优 context,也没有 renderer reward。 |
| Agent | NRR 决定应访问哪些节点,NGR 检查节点是否视觉正确。 | 可转化为 agentic search 的候选选择奖励与视觉 grounded 检查。 | SaGe 没有工具调用、状态持久化、图编辑、回滚或多轮渲染。 |
SaGe 最接近“结构化过程监督”,而不是完整 agent。它提供一个重要设计原则:将最终任务难以验证的路径,拆成可局部验证的节点代理目标。但在程序化材质中,节点代理必须同时满足外观解释与可执行图语义。
对当前课题的具体启示
当前研究框架是:
以上是 context optimized agentic procedural material generation 的研究框架,不是 SaGe 论文提出的公式或原始贡献。
建议的 material feature graph
不要直接把 Substance Designer 节点当作图像 context 的第一层。先建立与视觉证据对齐的中间图 (C),再由 agent 将其编译为程序化材质图 (G)。一个可操作节点可以写成:
其中 \(s_k\) 表示尺度,\(r_k\) 表示空间区域或 mask,\(a_k\) 表示外观属性,\(\ell_k\) 表示层次或遮挡关系,\(\omega_k\) 表示周期性与方向性,\(\gamma_k\) 表示目标材质通道。边应表达 contains、overlaps、modulates、masks、aligned with、drives channel 等可验证关系。
将两种节点奖励改造为 renderer in the loop
| SaGe 信号 | 材质版定义 | 可验证方式 |
|---|---|---|
| node grounded | 某个 feature node 是否对应参考图像中的真实局部结构 | 局部 crop 或 mask 上的多尺度特征相似度、法线与频谱统计 |
| node relevance | 当前选中的特征是否有助于解释目标材质 | 删除该节点后渲染奖励下降多少,作为边际贡献 |
| accuracy | 最终渲染与参考图像是否一致 | CLIP、DINO、LPIPS、频谱、颜色直方图与通道约束的组合 |
| format | 程序图是否满足语法与类型约束 | Compiler、Substance Automation Toolkit 或 Blender 执行成功 |
推荐实验矩阵
- Context 表示。flat caption、区域列表、层级 feature graph、feature graph 加多尺度统计。
- 生成策略。单次 LLM、带约束解码、agentic search、agentic search 加回溯。
- 反馈。无反馈、全局 rendering feedback、节点边际贡献、全局与节点联合奖励。
- 关键消融。去掉尺度、mask、关系、通道标签、过程轨迹、局部 reward,观察图合法率与渲染相似度。
先固定一个小型可执行材质节点库,选择 3 至 5 类结构明显的材质。Context Optimizer 输出层级 material feature graph,Agent 逐步选择节点与参数,每一步都可渲染。比较 flat image prompt 与结构化 context,在同一闭源模型、同一预算下的成功率、节点效率、回滚次数和最终外观指标。
SaGe 没做,而当前课题应补上的验证
- context 节点删除与关系反转,测试表示是否具有因果作用。
- 过程轨迹重放,检查相同轨迹能否稳定得到相同程序图。
- 程序节点的边际渲染贡献,防止 agent 生成装饰性或无效节点。
- 全局相似与局部结构同时评价,避免只优化颜色或低频外观。
- 同 token、同调用次数、同渲染预算的公平比较。
References
- Yang, Zhiwei, et al. Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models. arXiv:2607.05716v3, 2026. PDF.
- Yang, Zhiwei, et al. SaGe official repository. GitHub, accessed 2026 年 9 月 11 日.
- International Conference on Machine Learning. ICML 2026 accepted paper and download index.
- Bai, Shuai, et al. Qwen2.5 VL Technical Report. arXiv, 2025.
- Yang, Lihe, et al. Depth Anything: Unleashing the Power of Large Scale Unlabeled Data. CVPR, 2024.
- Kirillov, Alexander, et al. Segment Anything. ICCV, 2023.
- Kirillov, Alexander, et al. SA 1B Dataset. Meta AI, 2023.
- Lin, Tsung Yi, et al. Microsoft COCO: Common Objects in Context. ECCV, 2014.
- Masry, Ahmed, et al. ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. ACL Findings, 2022.
- Guo, Daya, et al. DeepSeek R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv, 2025.
核查优先级为论文 v3 PDF、附录、官方仓库与 ICML 官方列表。网页中所有研究迁移方案均已用“分析判断”或“建议”标识,与论文结论分开。