Paper Reading · Visual Sketchpad
NeurIPS 2024 · Deep Reading

Visual Sketchpad

把图像从一次性输入,变成可写入、可观察、可继续推理的视觉工作记忆。

完整题名 Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models版本 arXiv v3,2024-11-11状态 NeurIPS 2024 accepted

核心结论

Visual Sketchpad 不是一个新训练的视觉语言模型,而是一套测试时智能体框架。它让现成多模态模型写 Python 代码,调用绘图包或视觉专家,把 bounding box、mask、mark、line、depth map、crop 等结果显示出来,再把这些图像作为下一轮观察继续推理。

论文事实它最重要的贡献不是某一种视觉工具,而是把“选择工具、生成视觉产物、观察结果、改变后续计划”组织成闭环。

训练
无需微调
off-the-shelf GPT-4 Turbo / GPT-4o
平均提升
数学 12.7%,视觉 8.6%
摘要汇总口径
最强单项
V*Bench 80.3%
GPT-4o + Sketchpad

分析判断对当前课题的真正价值

它证明了 context representation 可以是外显、可操作、可迭代的视觉对象,而不必只是文本描述或隐藏向量。对参考图像到程序化材质图的任务,最可迁移的思想是让智能体先构造多尺度材质草图,再据此生成和修订程序化材质图。

论文身份与贡献边界

论文作者为 Yushi Hu、Weijia Shi、Xingyu Fu、Dan Roth、Mari Ostendorf、Luke Zettlemoyer、Noah A. Smith 与 Ranjay Krishna。arXiv 首次提交于 2024 年 6 月 13 日,v3 于 2024 年 11 月 11 日更新,页面明确标注已被 NeurIPS 2024 接收。题名和 venue 没有歧义。arXiv 记录官方项目页

论文实际提出
Visual Sketchpad 框架

以多轮视觉 Thought、Action、Observation 扩展 ReAct,让模型可通过代码生成视觉中间产物。

论文没有提出
新 backbone 或训练目标

没有微调 GPT-4 系列,没有学习工具策略,没有 outcome reward,也没有端到端视觉 token 生成。

研究动机与 significance

文本 Chain-of-Thought 能保存语言推理,却不善于承载密集空间信息。人类会画辅助线、圈选区域、标号和局部放大,从而外化工作记忆。论文把这一认知动作工程化:视觉不再只是初始输入,而是智能体可反复写入和读取的工作区。论文进一步主张,深度图和分割等密集信息很难被语言高效表达,而视觉界面能够保留这些结构。论文 §1、§3、§6

问题定义与形式化

论文事实输入是多模态查询 \(q\),包含文本与一个或多个图像。系统维护上下文 \(c_t\),其中累积查询、先前 thought、action 和 observation。第 \(t\) 轮先产生计划 \(p_t\),再生成并执行动作 \(a_t\),环境返回观察 \(o_{t+1}\),随后更新:

\[c_{t+1}=(c_t,p_t,a_t,o_{t+1}).\]

当模型认为信息充分时,输出特殊的 TERMINATE 以及答案。论文没有把这一过程训练成策略,也没有给出显式优化目标。论文 §3.1

分析性形式化便于理解,但不是论文原式

可以把模型看作策略 \(\pi_{\theta}\),环境由代码执行器与视觉专家构成:

\[p_t,a_t\sim\pi_{\theta}(\cdot\mid c_t),\qquad o_{t+1}=\mathcal{E}(a_t),\qquad y=\pi_{\theta}(\cdot\mid c_T).\]

此处 \(\theta\) 在实验中固定,没有梯度更新。系统改进来自测试时上下文变化,而非参数学习。

输入与输出

任务级输入、视觉工作区与最终输出
任务初始输入可生成的中间视觉内容最终输出
几何问题文本、图形及其 Matplotlib 代码辅助线与更新后的几何图数值或证明式答案
函数函数表达式Matplotlib 曲线奇偶性、凸凹性类别
图算法邻接矩阵或图像NetworkX 节点图连通性、最大流、同构判断
棋局FEN棋盘图白胜、黑胜或和棋
视觉推理图像与问题框、mask、mark、深度图、crop、overlay多选或自由文本答案

系统机制

Visual Sketchpad 的多轮执行闭环多模态查询进入规划器,规划器生成 Python 动作,Jupyter 和视觉专家执行,生成图像观察并回流到上下文,直到终止。 多模态查询 q文本 + 图像 PlannerTHOUGHT + Python ACTIONGPT-4 Turbo / GPT-4o 执行环境Jupyter kernel绘图库 / 视觉专家持久变量状态 Observation图像 + 文本 / 错误 新视觉产物写回上下文,继续规划 ANSWER + TERMINATE
结构化重绘,对应论文 Figure 2 与 §3。重点是图像 observation 回流,而不是单次工具调用。来源:paper Figure 2

代码生成与工具调用

  1. 系统 prompt 告知模型它处于 Python Jupyter notebook,并要求逐轮输出 THOUGHT 与可执行 Python code block。
  2. 初始 prompt 注入函数签名、docstring、坐标约定、错误警告和示例,但不注入工具完整实现。
  3. parser 从回复中提取代码。AutoGen 的本地 Jupyter 执行器在同一会话内运行代码,因此变量与中间状态可跨轮保留。
  4. display(...) 产生的 PIL 图像被保存并以图像内容加入下一轮 observation。执行失败时,错误消息会要求模型修复完整代码。
  5. 最多自动回复轮数由代码中的 MAX_REPLY = 10 控制,回复出现 TERMINATE 时停止。

上述行为可由论文 Appendix C 与仓库中的 prompt.pyexecution.pymain.py 交叉核对。

安全与复现注意

仓库默认设置 AUTOGEN_USE_DOCKER=False,生成代码由本地 Jupyter 执行。论文实验环境是研究原型,不等同于安全沙箱。复现时应隔离文件系统、网络与凭据,并设置执行超时和资源限额。

视觉中间产物

模型并不直接“想象”这些中间图,而是决定何时调用工具,工具生成可视化结果,模型再读取它们。

视觉工具与信息功能
视觉产物生成方式返回内容推理功能关键默认值
Bounding boxGrounding DINO,开放词汇检测带类别与序号的标注图,归一化 \([x,y,w,h]\)定位对象,随后 crop 或判断相对位置box_threshold=0.35text_threshold=0.25
MaskSegment Anything 与 Semantic-SAM,沿用 SoM 实现彩色 mask、编号 mark、每个 segment 的 box分离对象,显示边界与空间关系granularity=1.8alpha=0.1
Marks分割结果上叠加数字标签从 1 开始的编号及对应 box把连续视觉区域离散成可引用对象anno_mode=['Mask','Mark']
Lines模型修改 Matplotlib 几何代码含辅助线的新图显化平行、垂直、延长线等几何关系无统一固定参数
Depth mapDepth AnythingInferno colormap 深度图比较前后关系,辅助三维结构判断暖色更近,冷色更远
Crop / zoom按归一化 box 裁剪局部放大图把小物体提升到模型可感知尺度padding≥0.05
Sliding windows在 16 个重叠窗口内运行检测可能含目标的局部 patch 与 box面向小目标的主动视觉搜索窗口边长 (1/3),步长 (2/9)
Overlay两个图像按 alpha 合成保留原图线索的组合图联合读取深度、分割、标签与原貌函数默认 alpha=0.3

工具定义来源:论文 §5.1、Appendix C 与官方仓库 tools.py。代码层默认值比正文更具体。

Bounding box 与 mask 到底由谁生成

视觉专家负责
预测像素区域

Grounding DINO 生成检测框,SAM 与 Semantic-SAM 生成分割,Depth Anything 生成深度。

多模态模型负责
决定查询与后续动作

模型选择工具、提供对象词、显示结果、读取标注、再决定是否 crop、overlay 或直接回答。

因此“模型生成 bounding box”需要精确表述为:模型通过代码调用检测器来获得 box,并把 box 可视化后用于继续推理。它通常不直接从语言 token 回归坐标。prompt 甚至明确提醒模型不擅长定位坐标,并要求把检测结果当作参考而非 ground truth。Appendix C

训练与推理设置

训练

论文事实没有训练阶段。论文明确写明框架不需要 fine-tuning 或 training,直接提示现成多模态模型进行 sketching。因此不存在训练数据规模、optimizer、learning rate、batch size、epoch、checkpoint 或训练 GPU 配置。

推理

可核查的推理与实现设置
项目设置证据
基础模型gpt-4-turbo-2024-04-29gpt-4o-2024-05-13论文 §4.1
仓库默认模型gpt-4oconfig.py
temperature0.0官方仓库 config.py
最大自动回复10官方仓库 MAX_REPLY
代理框架AutoGen,README 固定 pyautogen==0.2.26官方 README
执行环境本地 Jupyter server,同一对话共享 kernelexecution.py 与 prompt.py
视觉专家部署三个 Gradio 服务,可放置在远端 GPU 服务器README 与 installation.md
vision prompt所有计算机视觉任务使用同一模板,含六个 in-context examplesAppendix C
重复运行与随机种子未充分报告主表未给出多次采样均值、方差或置信区间论文与公开仓库
Prompt 的核心约束
  • 图像左上角是原点,坐标归一化到 \([0,1]\)。
  • box 使用 \([x,y,w,h]\) 格式。
  • 模型被提醒自身定位和小细节识别能力有限,应使用检测与 zoom 工具。
  • 每轮只输出当前 THOUGHT 和 ACTION,执行结果返回后再规划下一步。
  • 检测 query 应为简单名词或短语,避免抽象概念。
  • 检测可能漏检或误检,需要通过图像观察 double-check。
代码执行错误如何处理

parser 或执行失败后,环境把错误文本反馈给模型,要求修复并重新输出完整代码。成功时则返回文本输出及图像,并要求生成下一轮 THOUGHT 与 ACTION。它具备基本的执行级自修复,但论文没有单独量化代码错误率、平均修复轮数或修复成功率。

数据构造与 benchmark

论文没有构建新的训练集,因为系统不训练。实验数据来自现有 benchmark,并将每个实例预处理为独立任务文件夹。部分完整任务数据和所有论文运行轨迹通过项目仓库及外部云盘提供。代码与数据说明

论文 Table 5 与 Table 6:实际评测样本
来源子任务样本数分区输入表示
IsoBenchMath Parity383valcode
Math Convexity255valcode
Graph Maxflow128valarray
Graph Connectivity128valarray
Graph Isomorphism128valarray
Winner ID257valFEN
V*BenchSmall object visual search257未标注单图
MMVP视觉缺陷诊断问题300未标注单图
BLINKRelative Depth124val单图
Spatial Relation143val单图
Jigsaw Puzzle150val多图
Visual Correspondence172val多图
Semantic Correspondence139val多图

论文事实Geometry 数量

Table 1 报告 geometry 结果,但 Appendix D 的统计表没有列出该子集样本数。公开资料在本文核查范围内未给出一个可与主表直接对应的明确数量,因此不补猜。

实验、baseline、指标与结果

所有主任务的指标都是 accuracy,主表没有报告置信区间。数学与图算法对比无 Sketchpad 的 GPT-4 Turbo、GPT-4o,以及 Gemini-Pro、Claude 3 Opus、Mixtral 8×7B、LLaMA-2-70B。视觉任务还对比 GPT-4V-preview、LLaVA、Gemini、Claude 及此前 SOTA。单图任务进一步对照 SoM、SoM + original image 和改造后的 Visprog。

Table 1:数学、几何、图与棋局

Accuracy,单位为百分比。加粗蓝色表示同一基础模型加入 Sketchpad 后的结果。
模型GeometryMaxflowIsomorphismConnectivityConvexityParityWinner ID
GPT-4 Turbo37.532.862.566.057.080.550.4
GPT-4 Turbo + Sketchpad45.896.897.697.677.371.564.2
绝对变化+8.3+64.0+35.1+31.6+20.3−9.0+13.8
GPT-4o62.525.050.896.187.284.461.1
GPT-4o + Sketchpad66.766.365.398.494.994.764.6
绝对变化+4.2+41.3+14.5+2.3+7.7+10.3+3.5

解读增益高度不均匀。最大流和图结构任务受益极大,说明将数组转换成空间结构特别有效。但 GPT-4 Turbo 的 parity 下降 9.0 点,直接反驳“视觉化总能帮助”的强版本主张。论文正文说“most tasks”,比摘要中较宽泛的“all tasks”更准确。论文 Table 1

Table 2:复杂视觉推理

Accuracy,单位为百分比
模型V*BenchMMVPDepthSpatialJigsawVis. Corr.Sem. Corr.
GPT-4 Turbo52.571.066.168.564.748.830.9
+ Sketchpad71.073.368.580.468.552.342.4
绝对变化+18.5+2.3+2.4+11.9+3.8+3.5+11.5
GPT-4o66.085.371.872.064.073.348.6
+ Sketchpad80.386.383.981.170.780.858.3
绝对变化+14.3+1.0+12.1+9.1+6.7+7.5+9.7

论文事实GPT-4o + Sketchpad 在当时报告的七项任务均达到新 SOTA。对 BLINK 五项任务,平均绝对增益为 GPT-4 Turbo 6.6 点、GPT-4o 9.0 点。论文 Table 2

Table 3:框架级对照

单图任务上的增强框架比较
基础模型与增强V*MMVPDepthSpatial
GPT-4 Turbo52.571.066.168.5
SoM42.060.758.978.3
SoM + orig.51.374.366.979.7
Visprog33.216.367.853.8
Sketchpad71.073.368.580.4
GPT-4o66.085.371.872.0
SoM49.070.762.983.2
SoM + orig.68.184.075.082.5
Visprog32.417.346.837.8
Sketchpad80.386.383.981.1

解读Sketchpad 是唯一在这四项单图任务上对两个基础模型都保持一致提升的框架。SoM 在 Spatial 很强,但会在其他任务干扰模型。Visprog 的固定程序组合容易累积视觉模块错误。这里更支持“自适应选择和观察工具”而非“任何视觉标注都有效”。

消融与诊断

关键缺口论文没有标准组件消融

没有逐一移除 detection、segmentation、depth、crop、overlay,也没有比较零示例、六示例、不同最大轮数或不同温度。因此无法从因果上分解每个工具和 prompt 部分的贡献。

  • 工具使用统计,Figure 4:V* 主要使用 detection、sliding window 与 zoom;Depth 主要调用深度估计;Spatial 主要使用 detection 与 segmentation。GPT-4o 总体调用工具更频繁。Semantic Correspondence 中 GPT-4o 使用 segmentation 的实例约 40%,而 GPT-4 Turbo 使用 detection 少于 20%,且很少用 segmentation。
  • 人类计划验证:几何题上,人类与 GPT-4o 画相同辅助线的比例为 80%。视觉任务抽取每项 10 题,由 2 名受试者判断完整计划,92.8% 被评为有效。多数错误归因于视觉专家失败或简单 VQA 错误,而非计划本身。
  • Oracle Sketchpad,Table 4:把 GPT-4o 最后一次 action 产生的视觉产物直接喂给 LLaVA-NeXT。LLaVA-NeXT-13B 的 Geometry 从 11.1 到 22.2,Winner ID 从 5.8 到 36.7;LLaVA-NeXT-34B 的 Maxflow 从 0.8 到 14.1,Convexity 从 81.6 到 87.1。这说明产物对别的模型也可能有价值,但不是开放模型自主规划能力的证明。

关键 Figure 与 Table 解读

论文视觉证据地图
编号原图结构应该读出什么不能过度解读什么
Figure 1几何辅助线、函数曲线、图结构、棋盘、视觉搜索示例同一思想可跨符号和自然图像任务示例成功不等于平均可靠性
Figure 2Thought、Action、Observation 闭环视觉产物是下一轮上下文的一部分它不是学习到的 world model
Figure 3Depth + overlay,segment/mark + crop工具可组合,模型可根据观察追加操作未证明组合顺序最优
Figure 4四类视觉任务的工具调用比例工具选择随任务变化,GPT-4o 更主动调用频率不等于工具因果贡献
Figure 5函数奇偶性与多图 correspondence 轨迹中间图像把抽象或局部关系外显只是定性样例
Table 1七项数学、几何、图、棋局结果结构重表达在图算法上收益最大Parity 存在负增益
Table 2七项视觉任务主结果视觉搜索、深度、空间关系收益明显没有方差与显著性检验
Table 3SoM、SoM + orig.、Visprog、Sketchpad闭环自适应优于静态标注或固定视觉程序baseline 适配是否完全公平仍可讨论
Table 4LLaVA-NeXT + oracle visual artifact视觉产物具有跨模型可用性不是开放模型端到端 Sketchpad
不同任务对应的工具偏好小目标搜索偏好检测、滑窗和放大,深度任务偏好深度图,空间关系偏好检测和分割,语义对应中 GPT-4o 更常用分割。 任务常用视觉动作获得的信息 V* 小目标Detection · Sliding window · Zoom局部目标可见性 Relative DepthDepth map · Overlay前后与三维结构 Spatial / Corr.Detection · Mask · Marks对象身份与关系
基于论文 Figure 4 的结构化重绘。原论文给出工具调用比例;此图只保留作者明确描述的任务偏好,不补造未公开数值。

复现细节与可复现性

官方仓库公开 agent、tasks、vision_experts、示例 outputs 与轨迹查看 notebook,许可证为 Apache-2.0。数学与几何任务只需 API、AutoGen、Jupyter 及绘图库。视觉任务还需 Semantic-SAM、Grounding DINO、Depth Anything,并通过 Gradio server 暴露。官方代码仓库

复现核查清单
层级已公开仍缺失或不稳定
LLM具体 API snapshot、temperature 0.0、prompt、最大轮数旧模型 snapshot 可用性与 API 行为漂移
AgentAutoGen 版本、parser、执行反馈、终止逻辑论文主表未报告重试策略统计与异常实例处理比例
视觉专家模型家族、checkpoint 获取、Gradio 接口论文未报告完整硬件、显存、吞吐与各模型精确版本哈希
数据预处理任务结构、部分仓库数据、外部下载链接、运行轨迹外部云盘长期稳定性与 geometry 数量说明
统计逐任务 accuracy 与样本数无方差、置信区间、显著性检验、独立重复次数

推理成本

论文 Table 7:GPT-4o 每样本 token 与当时估算成本
任务tokens / sampleUSD / sample
Math Parity2,9940.015
Math Convexity2,2110.011
Graph Connectivity2,8190.014
Graph Isomorphism3,1430.016
V*Bench26,6470.133
MMVP11,8700.059
BLINK Relative Depth14,0780.070
BLINK Spatial Relation12,8480.064
BLINK Jigsaw Puzzle13,2060.066
BLINK Visual Correspondence16,9880.085
BLINK Semantic Correspondence11,5080.058

这些是论文发表时基于 GPT-4o 的成本,不代表当前 API 价格。Table 7 未列 Geometry、Graph Maxflow 和 Winner ID。

复现判断

代码路径足够复现系统形态,但未必能精确复现 2024 年主表。主要原因是闭源 API snapshot 漂移、视觉专家依赖较重、版本锁定不完整,以及没有多次运行统计。更合理的目标是复现框架趋势,并用当前可固定版本的 VLM 重新建立结果。

局限、失败模式与 reviewer 式锐评

论文承认
计算成本更高

多轮 LLM 调用、图像 token、代码执行和视觉专家推理叠加。

论文承认
只研究测试时使用

没有训练模型学习何时 sketch、画什么、何时停止。

实证失败
视觉化可能干扰

GPT-4 Turbo 的 parity 下降 9.0 点,SoM 也会在若干任务伤害性能。

系统失败
专家错误与 VQA 错误

漏检、误检或对生成图的误读会污染后续上下文。

Reviewer 式评价

强项

  • 问题直觉清楚,框架简洁,跨数学与自然视觉任务验证。
  • 区别于固定 visual program,智能体能在看到中间图后继续调整计划。
  • 公开 prompt、代码、任务预处理和轨迹,便于研究后续工具学习。

主要质疑

  • 因果归因不足:缺少工具逐项消融与轮数、示例数、原图保留策略的控制实验。
  • 统计可靠性不足:只报告单一 accuracy,闭源模型又可能有运行随机性,无法判断小幅增益是否稳定。
  • 比较公平性有限:Visprog 被替换部分模块,SoM 又增加了 “+ orig.” 变体,但各方法的 prompt 长度、token 成本和工具预算未统一。
  • 主动纠错仅被论述:作者说模型原则上可看到错误并改计划,但没有专门测量错误检测和恢复成功率。
  • 开源模型证据是 oracle:Table 4 使用 GPT-4o 生成的最后视觉产物,不能说明 LLaVA 能自己规划并画图。
  • 安全边界薄弱:默认本地执行生成代码,不适合直接迁移到真实生产环境。

综合判断这是一篇强“范式展示”论文,而不是完整的学习算法论文。它证明了动态视觉上下文可提升推理,却没有证明当前工具集、计划策略或中间表示接近最优。

与程序化材质、Context Optimization、Agent 的关系

Visual Sketchpad 与程序化材质生成没有直接实验关系。下面均为迁移分析和研究建议,不应写成原论文贡献。

三条研究线的映射
研究线Visual Sketchpad 提供的证据迁移到程序化材质生成
Procedural Material Generation把难以语言化的密集视觉结构转成可观察中间产物将参考图像分解为全局布局、材料区域、频率层级、边界、法线与粗糙度线索,再生成程序化材质图
Context Optimization上下文不是静态 prompt,而是由工具产生并随轮次更新的视觉表示让 Context Optimizer 选择 crop、mask、频谱、尺度标尺、tile 检测和通道估计,形成 \(C^{\ast}\)
Agent模型自主决定工具调用,观察结果后修改下一步计划让 Agent 生成节点图、执行 renderer、比较 \(\hat I\) 与 \(I\),再修订结构和参数

统一研究框架

研究框架这不是 Visual Sketchpad 原始贡献

\[I \xrightarrow{\mathrm{Context\ Optimizer}} C^{\ast} \xrightarrow{\mathrm{Agent}} G \xrightarrow{\mathrm{Renderer}} \hat I\] \[C^{\ast}=\arg\max_C R\!\left(\mathrm{Render}(\mathrm{Agent}(C)),I\right).\]

Visual Sketchpad 对应的是第一段与第二段之间的接口设计思想:把 \(C^{\ast}\) 做成模型能直接观察和继续操作的视觉工作区。当前课题还需要加入 renderer-in-the-loop 的渲染反馈与对程序化材质图 \(G\) 的结构约束。

多尺度材质视觉上下文

面向程序化材质的多尺度视觉上下文参考图像被转化为全局布局、中尺度结构、细尺度纹理和物理通道四组上下文,供材质智能体构图与渲染验证。 参考图像 I原始像素 全局尺度主区域、方向、重复周期 中尺度裂缝、砖块、纤维束、边界 细尺度颗粒、孔隙、微划痕、频谱 物理通道albedo、normal、roughness、height 材质 Agent节点类型拓扑结构参数与随机种子智能体式搜索 Renderer渲染反馈
研究建议图。借鉴 Visual Sketchpad 的动态视觉工作区,但加入程序化材质特有的多尺度分解、物理通道和 renderer-in-the-loop。

哪些视觉产物最值得迁移

  1. mask + marks:把材质中的语义或结构区域离散成可引用对象,例如水泥基底、骨料、裂缝、污渍。marks 让模型能在文本轨迹中稳定指向某一区域。
  2. multi-scale crops:分别提供整体周期、中尺度 motif 和微表面统计,减少单一缩放下的尺度混淆。
  3. lines 与 orientation field:用于木纹、拉丝金属、纤维、划痕和层理的主方向表达。
  4. frequency sketch:增加频谱图、带通分解或局部自相关图,帮助匹配 procedural noise 的频率和 octave。
  5. render overlays:把参考图、当前渲染、差异热图和边缘图组合,使 Agent 能定位结构错误与参数错误。

对当前课题的具体实验议程

最有发表价值的问题不是“加几个视觉工具是否更好”,而是研究哪一种 context representation 能让材质 Agent 更高效、更可靠地搜索程序化材质图。

可检验假设

H1:多尺度上下文优于单图上下文

将参考图像分解为 global、meso、micro 三个尺度的结构化视觉上下文,会提高材质结构召回并减少错误节点类型。

H2:自适应上下文优于固定上下文

Agent 根据当前渲染失败模式主动请求 mask、crop、frequency 或 channel estimate,比预先固定提供全部上下文更节省 token 与工具成本。

H3:渲染差异驱动的视觉草图支持自修复

将差异热图、边缘差异和尺度分解差异写回上下文,可提高拓扑修订成功率,而不只是连续参数优化。

最小可发表实验矩阵

建议的主对照与消融
组别上下文Agent 闭环要回答的问题
A原始参考图像无工具基础 VLM 直接生成程序化材质图的能力
B原图 + 固定文本分解无工具prompt engineering 的增益
C原图 + 固定多尺度 crops / masks无自适应调用静态 context optimization 的增益
DAgent 自选视觉工具有,未使用 rendererVisual Sketchpad 式动态上下文的增益
EAgent 自选视觉工具 + 渲染差异完整 renderer-in-the-loop渲染反馈是否改善结构和参数
FOracle 上下文固定上下文表示的性能上界与 Agent 选择差距

评价指标

Render similarityLPIPS / DINO similarityScale-wise spectrum errorNormal / roughness consistencyNode precision / recallGraph edit distanceExecution successTool callsRender callsToken costWall timeRecovery rate

研究建议需要把最终图像相似度与图结构质量同时评估。仅优化像素或 CLIP 相似度可能得到视觉相近但不可编辑、不可泛化或依赖 bitmap 的伪程序化解。

必须补上的 Visual Sketchpad 缺失实验

  • 逐工具消融:mask、crop、frequency、orientation、channel estimate、difference map。
  • 固定预算:统一最大工具次数、render 次数、token 和时间,比较静态与动态上下文。
  • 错误注入:人为制造错 mask、错尺度和错渲染,测量 Agent 的发现率、恢复率与额外成本。
  • 跨材质类别泛化:规则纹理、随机颗粒、分层结构、有方向纹理、非平稳污渍分别报告。
  • 结构与参数分离:先评估节点拓扑,再评估参数搜索,避免最终 render 指标掩盖图结构错误。

References

  1. Hu, Y. et al. Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models. arXiv:2406.09403v3, 2024.
  2. Hu, Y. et al. Visual Sketchpad full paper and appendices. 32 pages, version dated 2024-11-11.
  3. Visual Sketchpad authors. Official project page. Project overview, examples and headline results.
  4. Yushi-Hu. VisualSketchpad official repository. Agent, tasks, outputs, vision experts and Apache-2.0 license.
  5. VisualSketchpad repository. agent/config.py. Model configuration, temperature, maximum replies and service addresses.
  6. VisualSketchpad repository. agent/prompt.py. Tool documentation, in-context examples and task prompts.
  7. VisualSketchpad repository. agent/execution.py. Local Jupyter execution and image result processing.
  8. VisualSketchpad repository. agent/tools.py. Detection, segmentation, depth, crop, sliding window and overlay implementations.
  9. VisualSketchpad repository. vision_experts/installation.md. Semantic-SAM, Grounding DINO and Depth Anything installation.
  10. Kirillov, A. et al. Segment Anything. ICCV 2023.
  11. Li, F. et al. Semantic-SAM: Segment and Recognize Anything at Any Granularity. 2023.
  12. Liu, S. et al. Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection. 2023.
  13. Yang, L. et al. Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data. CVPR 2024.
  14. Yang, J. et al. Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V. 2023.
  15. Fu, X. et al. BLINK: Multimodal Large Language Models Can See but Not Perceive. 2024.
  16. Wu, P. and Xie, S. V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs. 2023.
  17. Yao, S. et al. ReAct: Synergizing Reasoning and Acting in Language Models. 2022.
  18. Wu, Q. et al. AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. 2023.

证据标签说明

论文事实可由论文或官方代码直接支持。分析判断是基于证据的解释。研究框架是面向程序化材质课题的延伸。未报告表示公开资料不足,未补造数值。