Paper Reading
ICML 2026 · Multimodal Reasoning

Scene Graph Thinking

它不是在推理时调用一个场景图工具,而是用场景图生成监督数据,再让多模态模型学会输出节点式过程轨迹。真正的贡献在于结构化数据引擎与节点级强化学习信号。

准确标题Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models
作者Zhiwei Yang, Yuanchen Wu, Nan Zhang, Yucong Meng, Ke Yan, Shouhong Ding
版本arXiv:2607.05716v3,2026 年 7 月 13 日
VenueICML 2026,PMLR 306,第 43 届,韩国首尔

论文身份核验

“Scene Graph Thinking”对应的方法名为 SaGe。原文 PDF、arXiv 条目、ICML 2026 会议列表与作者仓库共同指向同一篇论文。

论文已确认

PDF 首页给出 arXiv v3、完整作者名单、ICML 2026、PMLR 306 与 Seoul。官方仓库也标注 2026 年 5 月 1 日被 ICML 接收。arXiv 条目 · ICML 2026 列表 · 官方仓库

姓名拼写差异。仓库可见文本曾写作 “Yuchen Wu” 与 “Yuxcong Meng”,但 PDF 首页和仓库 BibTeX 都是 Yuanchen Wu 与 Yucong Meng。本页采用论文 PDF 与 BibTeX 的一致写法。

原始 PDF 已包含 Appendix A 至 D,共 22 页。附录公开了训练批量、学习率、训练轮数、奖励 judge、数据构成、图质量统计和两类 judge prompt。仓库当前主要提供 README 与展示图片,并明确写明代码和数据仍处于内部审查,暂未形成可直接运行的公开复现包。

一页结论

120KSFT 场景图对齐样本
26K强化学习样本
8视觉 benchmark

SaGe 先把平坦图文数据转换成层级场景图。节点包含实体类别、属性、边界框与深度范围,边连接空间、交互和语义关系。随后从图中采样节点问题、关系问题、多跳轨迹和全局描述,用 120K 样本进行 SFT,再用 GRPO 与节点 grounded、节点 relevance、答案准确性和格式奖励进行强化微调。

论文结论

相对 Qwen2.5 VL 3B,SaGe 3B 在 VStarBench 从 75.4 提升到 89.0,在 CVBench 2D 从 67.0 提升到 77.8,在 CVBench 3D 从 66.5 提升到 72.3。主要收益集中在高分辨率细粒度感知与空间关系。

分析判断

SaGe 的“scene graph thinking”不是一个可查询、可回溯、可执行的在线图模块。训练时有显式图,推理时可见的是节点标签化的语言轨迹。结构是否被模型忠实执行,主要通过输出格式与节点奖励间接验证。

对当前课题的建议

最值得迁移的不是把通用场景图直接换成程序化材质图,而是把参考图像分解为可定位、可验证、可跨尺度组织的 material feature graph,再用渲染器提供闭环反馈。

问题定义与数学建模

传统图文数据被记作 \(D_{\mathrm{flat}}=\{(I_i,T_i)\}_{i=1}^{N}\),其中 \(I_i\) 是图像,\(T_i\) 是问题、指令或文本标注。SaGe 将每个样本提升为层级场景图 \(G_i=(V_i,E_i)\),并从图的拓扑中采样结构化文本:

\[ D_{\mathrm{SG}}=\{(I_i,T_i\mid G_i)\}_{i=1}^{N}. \]

这里的条件符号表示文本和推理轨迹由场景图约束生成,不表示推理时将完整 \(G_i\) 作为外部输入。单个节点定义为:

\[ v_t=(c_t,a_t,b_t,d_t),\qquad b_t=[x_t^{\min},y_t^{\min},x_t^{\max},y_t^{\max}],\qquad d_t=[z_t^{\min},z_t^{\max}]. \]

\(c_t\) 是实体类别,\(a_t\) 是属性,\(b_t\) 是二维边界框,\(d_t\) 是估计深度范围。采样器以场景图和全局 caption 为条件,生成问题、答案与节点轨迹:

\[ (q_i,a_i,\tau_i)=f(G_i,C_i),\qquad \tau_i=(v_1,v_2,\ldots,v_T). \]

轨迹中的每个访问节点以 <entity><bbox><depth> 标签显式表达,使类别、二维位置和粗深度同时成为可评分的过程证据。原文第 3 至 5 页

显式场景图如何构造

构图是一个离线、自动化、混合模型管线。它先扩大实体粒度,再补充深度,最后利用节点先验构边。

01 主实体Qwen2.5 VL 72B 识别显著对象、属性与边界框
02 子实体裁剪并放大主实体区域,再识别内部组成部分
03 深度Depth Anything 生成深度图,SAM 掩膜去除背景,再提取深度范围
04 关系以边界框、深度和组成结构作为先验,构造空间、交互和语义关系
论文 Figure 2,场景图构造的三个阶段
Figure 2 · Scene Graph Construction。原图展示 compositional node mining、depth aware node modeling 与 edge construction。来源:论文第 3 页。图像经原 PDF 裁切,仅用于学术解读。

节点层级

主对象先被建为一级节点,其裁剪区域再次送入 MLLM 识别组件。车可以拥有车牌、车灯等子节点。这解决了细小目标在整图尺度上被忽略的问题,也为多跳导航提供了“整体到部件”的结构。

深度不是精确几何

Depth Anything 先给出像素深度,SAM 根据边界框生成掩膜,边界腐蚀后只在掩膜内统计深度范围。原文明确说明深度值是用于前后关系推理的 range cue,不是度量深度,也没有跨图标定。

边表示仍不完全可复现

论文将边概括为空间、interaction 与 semantic 三类,并强调利用节点级先验减少直接由 MLLM 猜关系的错误。但没有公开完整 relation vocabulary、边 schema、冲突消解规则、方向约定或每类构边算法,因此“显式边”在概念上清楚,在工程上仍有缺口。

120K 数据引擎

在构图之后,作者先用视觉语言模型生成全局 caption \(C_i\),再让 GPT OSS 120B 从 \(G_i\) 与 \(C_i\) 中采样节点与边。节点中心问题覆盖颜色、形状、状态、材质等属性,边中心问题覆盖二维、三维空间关系与交互。输出同时包含 question、answer 和节点式 CoT。

Appendix C 报告的数据组成
数据类型样本数结构信号任务目标
属性中心25K实体与属性颜色 10K,状态 5K,形状 5K,材质 5K
空间推理30Kbbox 与 depth二维左右上下,三维前后关系
多跳轨迹25K关系路径沿边导航到目标节点
caption20K局部或全图遍历局部 10K,全局 10K
grounding10K边界框目标定位
counting10K实例集合目标计数,来源 COCO 2014

两轮过滤

  1. 使用 GME 类视觉文本嵌入模型计算裁剪区域与节点文本的相似度,低于阈值的样本被丢弃。论文未报告阈值。
  2. 使用 proprietary MLLM 交叉验证问题、答案、轨迹与标注的一致性。caption 还需通过 8 项规则并获得满分。
论文 Figure 3,训练数据采样与两轮验证
Figure 3 · Training Data Sampling and Verification。节点和边采样产生 CoT 数据,再经视觉文本相似度与 MLLM 复核,最终形成 120K 样本。来源:论文第 4 页。
质量证据

作者随机抽取 1,000 个原始图,用 Gemini 3 Pro 评估 22,029 个节点和 26,283 条边。节点正确率为 94.5%,边正确率为 92.9%。节点错误中 52.0% 来自属性与视觉区域不匹配,边错误中 55.6% 是 invalid relation。最终训练数据经人工随机复核的 failure rate 低于 1%。

证据边界

上述 94.5% 和 92.9% 是模型 judge 对构图结果的 precision 式评估,不是穷举标注下的 recall。论文也承认开放式层级节点难以完整标注,因此不能据此推断场景图覆盖了图像中的全部实体与关系。

两阶段训练与强化信号

SFT 教模型“怎样写结构化轨迹”,GRPO 再教模型“访问哪些节点,以及节点是否真的对应视觉区域”。

论文 Figure 4,监督微调与强化学习的两阶段训练
Figure 4 · Two stage Training Pipeline。SFT 内化图对齐轨迹,RL 使用 node grounded 和 node relevance 两类节点代理奖励。来源:论文第 5 页。

节点 grounded 奖励

对轨迹中的节点 \(v_t\),从 <entity> 提取描述 \(e_t\),从 <bbox> 提取区域 \(\phi(I_i,b_t)\)。多模态 judge 判断区域与实体类别及属性是否匹配:

\[ r_{\mathrm{gro}}(v_t)=g_{\mathrm{vis}}\!\left(e_t,\phi(I_i,b_t)\right). \]

judge 只输出 0 或 1,而且要求裁剪区域中不能有其他清晰对象。这一严格规则提高纯净 grounding,但对“手持物”“表面纹理”“整体与部件重叠”等天然复合区域可能过度惩罚。

节点 relevance 奖励

LLM judge 从问题与标准答案识别锚点集合 \(A\)。轨迹访问到锚点,或访问到被 judge 认为能为锚点提供必要语义支持的节点时,得到分级奖励 \(R\in\{1.0,0.8,0.5,0.2,0.0\}\):

\[ r_{\mathrm{rel}}(v_t)= \begin{cases} R, & e_t\in A\ \text{或在语义上支持}\ A,\\ 0, & \text{其他情况}. \end{cases} \]

完整轨迹奖励还包含答案准确性与格式奖励:

\[ R(\tau)=\frac{1}{T}\sum_{t=1}^{T}r_{\mathrm{gro}}(v_t)+\frac{1}{|A|}\sum_{t=1}^{T}r_{\mathrm{rel}}(v_t)+r_{\mathrm{acc}}+r_{\mathrm{fmt}}. \]

论文没有报告四项奖励的额外权重,公式等价地相加。值得注意的是 relevance 项以 \(|A|\) 归一化而非轨迹长度 \(T\),因此访问多个相关节点可能累计更高分。是否设置总分截断、是否防止重复节点获奖,公开资料未说明。

GRPO 目标

\[ \mathcal{L}_{\mathrm{GRPO}}=-\mathbb{E}\!\left[\min\!\left(\rho(\theta)\hat A,\operatorname{clip}(\rho(\theta),1-\epsilon,1+\epsilon)\hat A\right)+\beta\,\mathrm{KL}(\pi_{\theta}\Vert\pi_{\mathrm{ref}})\right]. \]

SFT 模型同时作为参考策略 \(\pi_{\mathrm{ref}}\)。每个样本生成 8 个 rollout,组内比较相对优势。论文没有报告 \(\epsilon\)、\(\beta\)、温度、最大生成长度或优化器参数。

Appendix D 的 node grounded judge prompt

要求 judge 对裁剪图与实体名进行二元匹配。只有实体名匹配、属性匹配且没有其他清晰对象时输出 1,任何一项不满足输出 0。更详细示例被作者省略。

Appendix D 的 node relevance judge prompt

先计算需 grounded 的实体总数,包括主语和提供关系支持的对象。再逐个给 extracted entities 评分:精确一致为 1.0,语义或属性相似为 0.8,主体正确但属性误用为 0.5,主体偏到容器或部件为 0.2,冲突、否定或无关为 0.0。输出严格 JSON。

训练时有图,推理时有轨迹

训练准备图像转成显式 JSON 场景图
监督样本从图采样节点式 CoT 与答案
模型推理输入图像与问题,直接输出带标签的 CoT
最终输出<answer> 中给出答案或边界框

论文展示的推理轨迹类似:先识别 car 节点,再识别 on the car 的 license plate 节点,节点后附 bbox 和 depth,最后回答颜色。这个过程在语言层面模拟图遍历,但测试时未先显式构造 \(G\),也未执行可验证的边查询。

论文已验证

在多个 QA benchmark 上,这种节点式轨迹能提升答案准确率、空间关系和 grounding,且 Figure 5 与 Figure 9 展示了正确的多跳案例。

不能从论文推出

不能据此断言模型内部形成了忠实、完整、持久的图结构,也不能断言输出轨迹是产生答案的真实因果过程。论文没有做隐变量探针、轨迹干预、边删除、反事实路径或在线 graph consistency 测试。

实验设计

模型与训练

Appendix A 可复现训练配置
阶段基础模型数据量epoch学习率总 batch其他
SFT cold startQwen2.5 VL 3B / 7B120K1\(1\times10^{-5}\)256random scaling
GRPOSFT checkpoint26K1\(1\times10^{-6}\)1288 rollouts

RL 数据由 2K COCO grounding、4K ChartQA 与 20K VStarBench train 样本组成。node grounded judge 使用 Qwen3 VL 30B A3B Instruct,node relevance 与 accuracy judge 使用 Qwen3 30B A3B Instruct。多项选择题按完全匹配给 0 或 1,grounding 直接以预测框和真值框的 IoU 作为 accuracy reward。

八个 benchmark

  • 高分辨率细粒度感知:VStarBench、HRBench 4K、HRBench 8K。
  • 二维与三维空间理解:CVBench 2D、CVBench 3D。
  • 通用视觉能力:MMStar、RefCOCO、ChartQA。

VQA 使用 accuracy,grounding 使用 Acc@0.5。baseline 包括 GPT 4o、GPT 5 Mini、Gemini 2.5 Pro,Qwen2.5 VL、LLaVA OneVision、InternVL3,以及 SEAL、DyFo、Vision R1、LVR、Pixel Reasoner、DeepEyes、Thyme 等细粒度或工具式视觉推理方法。

公平性注意。不同闭源模型与工具式方法的推理预算、图像分辨率和工具调用次数没有在本论文中统一披露。最干净的比较仍是同底座 Qwen2.5 VL 与 SaGe 的差值。

定量结果与消融

Table 1 选录:高分辨率 benchmark
方法参数VStar overallVStar attr.VStar spatialHRBench 4KHRBench 8K
Qwen2.5 VL3B75.480.967.166.063.1
SaGe3B89.086.193.472.068.9
Qwen2.5 VL7B76.477.475.068.865.3
SaGe7B89.085.294.776.573.4
DeepEyes7B85.687.384.575.172.6
Table 2 选录:空间与通用视觉 benchmark
方法CV 2D2D count2D relationCV 3D3D depth3D distanceMMStarRefCOCOChartQA
Qwen2.5 VL 3B67.062.472.666.573.659.352.286.382.2
SaGe 3B77.867.989.972.379.265.354.489.083.8
Qwen2.5 VL 7B73.662.484.973.379.866.760.388.185.6
SaGe 7B79.468.093.280.588.872.262.389.887.2

训练阶段消融

Table 3:SaGe 3B
条件SFTGRPO节点代理奖励VStarCV 2DCV 3D
Qwen2.5 VL 3B75.467.066.5
cold start83.275.569.7
vanilla GRPO85.976.269.3
SaGe89.077.872.3

SFT 已贡献主要增益。vanilla GRPO 继续提高 VStar 与 CVBench 2D,但 CVBench 3D 从 69.7 轻微降至 69.3。加入节点代理奖励后,三项指标都达到最高值。

CoT 表示消融

Table 4:逐步加入节点字段
轨迹形式entitybboxdepthVStarCV 2DCV 3D
answer only79.172.866.4
entity79.972.365.7
entity + bbox80.675.066.1
完整 SaGe CoT83.275.569.7

只加 entity 标签会让 CVBench 2D 与 3D 下降,说明“结构化文本”本身不是充分条件。bbox 对二维关系有效,depth 对三维关系有效,组合后才形成稳定收益。

奖励消融

Table 5:节点奖励的互补性
条件NGRNRRVStarCV 2DCV 3D
vanilla GRPO85.976.269.3
只加 NRR87.176.971.5
只加 NGR85.074.667.6
NGR + NRR89.077.872.3

NGR 单独使用反而全面下降,论文将其归因于 reward hacking:模型可能关注视觉上显著但与问题无关的节点。NRR 决定“去哪里”,NGR 判断“看到的是否正确”,两者组合才有效。

关键 Figure 与 Table 结构化解读

论文 Figure 6,数据规模和数据组成分析
Figure 6 · Data Scaling and Composition Analysis。左图显示 20K 至 120K 数据规模总体上升,右图显示从 grounding 与 counting 起步,逐步加入 attribute、relation、caption 与 multi hop 后继续改善。论文只在曲线中展示部分数值,正文明确报告 VStar 从加入 caption 后的 80.6 提升到加入 multi hop 后的 83.2。来源:论文第 8 页。
关键图表说明
编号它验证什么它没有验证什么
Figure 2混合管线能将实体、部件、bbox、depth 和多类关系组织为图。没有公开每一步的完整 prompt、阈值与 relation schema。
Figure 3图可用于生成节点或边中心问题,并通过两轮自动过滤。低于 1% failure rate 依赖抽样人工复核,未给样本数与置信区间。
Figure 4SFT 与节点代理奖励构成连续两阶段训练。示意图中的“图遍历”不等同于测试时存在外部图执行器。
Figure 5 / 9多个成功案例显示节点式 CoT 可定位细小对象、关系和图表元素。定性挑选案例不能衡量轨迹忠实性和失败率。
Table 3SFT 是最大单步增益来源,节点奖励进一步提升。没有控制同量普通 CoT 数据,无法完全分离图结构与额外数据质量的作用。
Table 4bbox 与 depth 分别给二维和三维任务带来针对性收益。没有测试 mask、尺度、关系类型或可执行图 token。
Table 5NGR 与 NRR 明显互补。没有报告 judge 一致性、误判率或奖励成本。

复现清单与公开缺口

中等偏低 公开复现成熟度

已经公开或明确报告

  • 基础模型、SFT 和 RL 数据规模、学习率、总 batch、epoch、rollout 数。
  • 120K 数据类别分布与 RL 三类数据来源。
  • 节点字段、两阶段训练逻辑、奖励公式、两类 judge 模型与主要 prompt。
  • 八个 benchmark、主要 baseline、定量表格和核心消融。

仍未公开或未说明

  • 可运行训练、数据生成和评测代码,仓库写明仍在内部审查。
  • 场景图 JSON 的完整 schema、relation vocabulary、构边规则、prompt 全文与过滤阈值。
  • 图像总量、各源图池精确抽样数、去重策略、许可追踪与 train benchmark contamination 检查。
  • 优化器、warmup、weight decay、图像 token 预算、最大序列长度、采样温度、GRPO 的 \(\epsilon\) 与 \(\beta\)。
  • GPU 类型、数量、训练时长、显存、推理延迟、judge 调用成本。
  • benchmark 具体 evaluation harness、图像预处理、解码配置与随机种子。
代码核查

官方 GitHub README 链接模型与数据页面,但同时明确写明代码和数据仍在内部审查。当前仓库的文件列表只显示 README 与 sources 下的三张展示图,安装命令引用的 requirements、verl 和 ms swift 目录并未出现在公开文件树中。因而截至本页核查时,不能把“有仓库”理解为“已可复现”。

局限、失败模式与 reviewer 式锐评

最强证据

同底座对比和字段级消融很有说服力。bbox 对二维关系、depth 对三维关系的定向收益符合机制预期。奖励消融也揭示 grounded reward 单独使用会伤害性能,而 relevance reward 能约束搜索方向,这比只报告最终分数更有信息量。

主要问题

  1. 显式图只在数据侧成立。论文标题容易让人以为测试时有真实图推理。实际上在线输出是标签化 CoT,没有外部图存储、边约束或可执行遍历。
  2. 轨迹忠实性未被验证。答案正确与节点文本看似合理,不代表这些节点在因果上促成答案。需要节点删除、bbox 扰动、关系反转和轨迹重放实验。
  3. teacher 与 judge 依赖重。构图依赖 Qwen2.5 VL 72B,采样依赖 GPT OSS 120B,过滤和 RL 又依赖多个强 judge。训练成本、闭源过滤模型和错误相关性都未量化。
  4. 图评估偏 precision。节点与边正确率很高,但没有 recall。漏掉微小实体或材质关系时,现有指标可能完全看不见。
  5. 数据量与结构贡献未完全解耦。缺少同图像、同数量、同 teacher 但用普通 caption 或普通 CoT 的强对照。
  6. 边奖励被回避。作者合理指出边关系可能多义,但以节点作为 proxy 会弱化真正的关系正确性。模型访问了两个正确节点,不等于它解释对了二者关系。

可能的失败模式

  • bbox 包含上下文对象时,严格 NGR 误判为 0。
  • 单目深度范围在反射、透明、重复纹理与极近景材质上不稳定。
  • 关系密集场景中,多条合法路径被 relevance judge 压缩为单一评分。
  • 模型通过生成宽泛实体名或大框规避属性错误。
  • 标签格式正确但节点重复,可能获得未披露的累计奖励。

与三条研究线的关系

从 SaGe 到程序化材质生成
研究线SaGe 的直接证据可迁移部分不能直接照搬
Procedural Material Generation实体、部件、属性、位置和关系可组织为层级 context representation。把材质拆成宏观结构、介观纹样、微观表面、通道依赖与空间关系。通用场景图节点是物体,材质程序节点是运算符,两者不是同一种图。
Context Optimizationflat image text 被转换为 \(G_i\),再采样更有效的监督轨迹。优化的不只是 prompt 文本,而是图结构、节点粒度、空间 grounding 与检索顺序。SaGe 没有在测试时对每张图显式求最优 context,也没有 renderer reward。
AgentNRR 决定应访问哪些节点,NGR 检查节点是否视觉正确。可转化为 agentic search 的候选选择奖励与视觉 grounded 检查。SaGe 没有工具调用、状态持久化、图编辑、回滚或多轮渲染。
迁移判断

SaGe 最接近“结构化过程监督”,而不是完整 agent。它提供一个重要设计原则:将最终任务难以验证的路径,拆成可局部验证的节点代理目标。但在程序化材质中,节点代理必须同时满足外观解释与可执行图语义。

对当前课题的具体启示

当前研究框架是:

\[ I \xrightarrow{\mathrm{Context\ Optimizer}} C^{\ast} \xrightarrow{\mathrm{Agent}} G \xrightarrow{\mathrm{Renderer}} \hat I \]
\[ C^{\ast}=\arg\max_C R\!\left(\mathrm{Render}(\mathrm{Agent}(C)),I\right). \]
来源声明

以上是 context optimized agentic procedural material generation 的研究框架,不是 SaGe 论文提出的公式或原始贡献。

建议的 material feature graph

不要直接把 Substance Designer 节点当作图像 context 的第一层。先建立与视觉证据对齐的中间图 (C),再由 agent 将其编译为程序化材质图 (G)。一个可操作节点可以写成:

\[ m_k=(s_k,r_k,a_k,\ell_k,\omega_k,\gamma_k), \]

其中 \(s_k\) 表示尺度,\(r_k\) 表示空间区域或 mask,\(a_k\) 表示外观属性,\(\ell_k\) 表示层次或遮挡关系,\(\omega_k\) 表示周期性与方向性,\(\gamma_k\) 表示目标材质通道。边应表达 contains、overlaps、modulates、masks、aligned with、drives channel 等可验证关系。

将两种节点奖励改造为 renderer in the loop

奖励迁移方案
SaGe 信号材质版定义可验证方式
node grounded某个 feature node 是否对应参考图像中的真实局部结构局部 crop 或 mask 上的多尺度特征相似度、法线与频谱统计
node relevance当前选中的特征是否有助于解释目标材质删除该节点后渲染奖励下降多少,作为边际贡献
accuracy最终渲染与参考图像是否一致CLIP、DINO、LPIPS、频谱、颜色直方图与通道约束的组合
format程序图是否满足语法与类型约束Compiler、Substance Automation Toolkit 或 Blender 执行成功

推荐实验矩阵

  1. Context 表示。flat caption、区域列表、层级 feature graph、feature graph 加多尺度统计。
  2. 生成策略。单次 LLM、带约束解码、agentic search、agentic search 加回溯。
  3. 反馈。无反馈、全局 rendering feedback、节点边际贡献、全局与节点联合奖励。
  4. 关键消融。去掉尺度、mask、关系、通道标签、过程轨迹、局部 reward,观察图合法率与渲染相似度。
最小可发表原型

先固定一个小型可执行材质节点库,选择 3 至 5 类结构明显的材质。Context Optimizer 输出层级 material feature graph,Agent 逐步选择节点与参数,每一步都可渲染。比较 flat image prompt 与结构化 context,在同一闭源模型、同一预算下的成功率、节点效率、回滚次数和最终外观指标。

SaGe 没做,而当前课题应补上的验证

  • context 节点删除与关系反转,测试表示是否具有因果作用。
  • 过程轨迹重放,检查相同轨迹能否稳定得到相同程序图。
  • 程序节点的边际渲染贡献,防止 agent 生成装饰性或无效节点。
  • 全局相似与局部结构同时评价,避免只优化颜色或低频外观。
  • 同 token、同调用次数、同渲染预算的公平比较。

References

  1. Yang, Zhiwei, et al. Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models. arXiv:2607.05716v3, 2026. PDF.
  2. Yang, Zhiwei, et al. SaGe official repository. GitHub, accessed 2026 年 9 月 11 日.
  3. International Conference on Machine Learning. ICML 2026 accepted paper and download index.
  4. Bai, Shuai, et al. Qwen2.5 VL Technical Report. arXiv, 2025.
  5. Yang, Lihe, et al. Depth Anything: Unleashing the Power of Large Scale Unlabeled Data. CVPR, 2024.
  6. Kirillov, Alexander, et al. Segment Anything. ICCV, 2023.
  7. Kirillov, Alexander, et al. SA 1B Dataset. Meta AI, 2023.
  8. Lin, Tsung Yi, et al. Microsoft COCO: Common Objects in Context. ECCV, 2014.
  9. Masry, Ahmed, et al. ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. ACL Findings, 2022.
  10. Guo, Daya, et al. DeepSeek R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv, 2025.

核查优先级为论文 v3 PDF、附录、官方仓库与 ICML 官方列表。网页中所有研究迁移方案均已用“分析判断”或“建议”标识,与论文结论分开。