核心结论
Visual Sketchpad 不是一个新训练的视觉语言模型,而是一套测试时智能体框架。它让现成多模态模型写 Python 代码,调用绘图包或视觉专家,把 bounding box、mask、mark、line、depth map、crop 等结果显示出来,再把这些图像作为下一轮观察继续推理。
论文事实它最重要的贡献不是某一种视觉工具,而是把“选择工具、生成视觉产物、观察结果、改变后续计划”组织成闭环。
分析判断对当前课题的真正价值
它证明了 context representation 可以是外显、可操作、可迭代的视觉对象,而不必只是文本描述或隐藏向量。对参考图像到程序化材质图的任务,最可迁移的思想是让智能体先构造多尺度材质草图,再据此生成和修订程序化材质图。
论文身份与贡献边界
论文作者为 Yushi Hu、Weijia Shi、Xingyu Fu、Dan Roth、Mari Ostendorf、Luke Zettlemoyer、Noah A. Smith 与 Ranjay Krishna。arXiv 首次提交于 2024 年 6 月 13 日,v3 于 2024 年 11 月 11 日更新,页面明确标注已被 NeurIPS 2024 接收。题名和 venue 没有歧义。arXiv 记录,官方项目页
以多轮视觉 Thought、Action、Observation 扩展 ReAct,让模型可通过代码生成视觉中间产物。
没有微调 GPT-4 系列,没有学习工具策略,没有 outcome reward,也没有端到端视觉 token 生成。
研究动机与 significance
文本 Chain-of-Thought 能保存语言推理,却不善于承载密集空间信息。人类会画辅助线、圈选区域、标号和局部放大,从而外化工作记忆。论文把这一认知动作工程化:视觉不再只是初始输入,而是智能体可反复写入和读取的工作区。论文进一步主张,深度图和分割等密集信息很难被语言高效表达,而视觉界面能够保留这些结构。论文 §1、§3、§6
问题定义与形式化
论文事实输入是多模态查询 \(q\),包含文本与一个或多个图像。系统维护上下文 \(c_t\),其中累积查询、先前 thought、action 和 observation。第 \(t\) 轮先产生计划 \(p_t\),再生成并执行动作 \(a_t\),环境返回观察 \(o_{t+1}\),随后更新:
当模型认为信息充分时,输出特殊的 TERMINATE 以及答案。论文没有把这一过程训练成策略,也没有给出显式优化目标。论文 §3.1
分析性形式化便于理解,但不是论文原式
可以把模型看作策略 \(\pi_{\theta}\),环境由代码执行器与视觉专家构成:
此处 \(\theta\) 在实验中固定,没有梯度更新。系统改进来自测试时上下文变化,而非参数学习。
输入与输出
| 任务 | 初始输入 | 可生成的中间视觉内容 | 最终输出 |
|---|---|---|---|
| 几何 | 问题文本、图形及其 Matplotlib 代码 | 辅助线与更新后的几何图 | 数值或证明式答案 |
| 函数 | 函数表达式 | Matplotlib 曲线 | 奇偶性、凸凹性类别 |
| 图算法 | 邻接矩阵或图像 | NetworkX 节点图 | 连通性、最大流、同构判断 |
| 棋局 | FEN | 棋盘图 | 白胜、黑胜或和棋 |
| 视觉推理 | 图像与问题 | 框、mask、mark、深度图、crop、overlay | 多选或自由文本答案 |
系统机制
代码生成与工具调用
- 系统 prompt 告知模型它处于 Python Jupyter notebook,并要求逐轮输出 THOUGHT 与可执行 Python code block。
- 初始 prompt 注入函数签名、docstring、坐标约定、错误警告和示例,但不注入工具完整实现。
- parser 从回复中提取代码。AutoGen 的本地 Jupyter 执行器在同一会话内运行代码,因此变量与中间状态可跨轮保留。
display(...)产生的 PIL 图像被保存并以图像内容加入下一轮 observation。执行失败时,错误消息会要求模型修复完整代码。- 最多自动回复轮数由代码中的
MAX_REPLY = 10控制,回复出现TERMINATE时停止。
上述行为可由论文 Appendix C 与仓库中的 prompt.py、execution.py、main.py 交叉核对。
安全与复现注意
仓库默认设置 AUTOGEN_USE_DOCKER=False,生成代码由本地 Jupyter 执行。论文实验环境是研究原型,不等同于安全沙箱。复现时应隔离文件系统、网络与凭据,并设置执行超时和资源限额。
视觉中间产物
模型并不直接“想象”这些中间图,而是决定何时调用工具,工具生成可视化结果,模型再读取它们。
| 视觉产物 | 生成方式 | 返回内容 | 推理功能 | 关键默认值 |
|---|---|---|---|---|
| Bounding box | Grounding DINO,开放词汇检测 | 带类别与序号的标注图,归一化 \([x,y,w,h]\) | 定位对象,随后 crop 或判断相对位置 | box_threshold=0.35,text_threshold=0.25 |
| Mask | Segment Anything 与 Semantic-SAM,沿用 SoM 实现 | 彩色 mask、编号 mark、每个 segment 的 box | 分离对象,显示边界与空间关系 | granularity=1.8,alpha=0.1 |
| Marks | 分割结果上叠加数字标签 | 从 1 开始的编号及对应 box | 把连续视觉区域离散成可引用对象 | anno_mode=['Mask','Mark'] |
| Lines | 模型修改 Matplotlib 几何代码 | 含辅助线的新图 | 显化平行、垂直、延长线等几何关系 | 无统一固定参数 |
| Depth map | Depth Anything | Inferno colormap 深度图 | 比较前后关系,辅助三维结构判断 | 暖色更近,冷色更远 |
| Crop / zoom | 按归一化 box 裁剪 | 局部放大图 | 把小物体提升到模型可感知尺度 | padding≥0.05 |
| Sliding windows | 在 16 个重叠窗口内运行检测 | 可能含目标的局部 patch 与 box | 面向小目标的主动视觉搜索 | 窗口边长 (1/3),步长 (2/9) |
| Overlay | 两个图像按 alpha 合成 | 保留原图线索的组合图 | 联合读取深度、分割、标签与原貌 | 函数默认 alpha=0.3 |
工具定义来源:论文 §5.1、Appendix C 与官方仓库 tools.py。代码层默认值比正文更具体。
Bounding box 与 mask 到底由谁生成
Grounding DINO 生成检测框,SAM 与 Semantic-SAM 生成分割,Depth Anything 生成深度。
模型选择工具、提供对象词、显示结果、读取标注、再决定是否 crop、overlay 或直接回答。
因此“模型生成 bounding box”需要精确表述为:模型通过代码调用检测器来获得 box,并把 box 可视化后用于继续推理。它通常不直接从语言 token 回归坐标。prompt 甚至明确提醒模型不擅长定位坐标,并要求把检测结果当作参考而非 ground truth。Appendix C
训练与推理设置
训练
论文事实没有训练阶段。论文明确写明框架不需要 fine-tuning 或 training,直接提示现成多模态模型进行 sketching。因此不存在训练数据规模、optimizer、learning rate、batch size、epoch、checkpoint 或训练 GPU 配置。
推理
| 项目 | 设置 | 证据 |
|---|---|---|
| 基础模型 | gpt-4-turbo-2024-04-29,gpt-4o-2024-05-13 | 论文 §4.1 |
| 仓库默认模型 | gpt-4o | config.py |
| temperature | 0.0 | 官方仓库 config.py |
| 最大自动回复 | 10 | 官方仓库 MAX_REPLY |
| 代理框架 | AutoGen,README 固定 pyautogen==0.2.26 | 官方 README |
| 执行环境 | 本地 Jupyter server,同一对话共享 kernel | execution.py 与 prompt.py |
| 视觉专家部署 | 三个 Gradio 服务,可放置在远端 GPU 服务器 | README 与 installation.md |
| vision prompt | 所有计算机视觉任务使用同一模板,含六个 in-context examples | Appendix C |
| 重复运行与随机种子 | 未充分报告主表未给出多次采样均值、方差或置信区间 | 论文与公开仓库 |
Prompt 的核心约束
- 图像左上角是原点,坐标归一化到 \([0,1]\)。
- box 使用 \([x,y,w,h]\) 格式。
- 模型被提醒自身定位和小细节识别能力有限,应使用检测与 zoom 工具。
- 每轮只输出当前 THOUGHT 和 ACTION,执行结果返回后再规划下一步。
- 检测 query 应为简单名词或短语,避免抽象概念。
- 检测可能漏检或误检,需要通过图像观察 double-check。
代码执行错误如何处理
parser 或执行失败后,环境把错误文本反馈给模型,要求修复并重新输出完整代码。成功时则返回文本输出及图像,并要求生成下一轮 THOUGHT 与 ACTION。它具备基本的执行级自修复,但论文没有单独量化代码错误率、平均修复轮数或修复成功率。
数据构造与 benchmark
论文没有构建新的训练集,因为系统不训练。实验数据来自现有 benchmark,并将每个实例预处理为独立任务文件夹。部分完整任务数据和所有论文运行轨迹通过项目仓库及外部云盘提供。代码与数据说明
| 来源 | 子任务 | 样本数 | 分区 | 输入表示 |
|---|---|---|---|---|
| IsoBench | Math Parity | 383 | val | code |
| Math Convexity | 255 | val | code | |
| Graph Maxflow | 128 | val | array | |
| Graph Connectivity | 128 | val | array | |
| Graph Isomorphism | 128 | val | array | |
| Winner ID | 257 | val | FEN | |
| V*Bench | Small object visual search | 257 | 未标注 | 单图 |
| MMVP | 视觉缺陷诊断问题 | 300 | 未标注 | 单图 |
| BLINK | Relative Depth | 124 | val | 单图 |
| Spatial Relation | 143 | val | 单图 | |
| Jigsaw Puzzle | 150 | val | 多图 | |
| Visual Correspondence | 172 | val | 多图 | |
| Semantic Correspondence | 139 | val | 多图 |
论文事实Geometry 数量
Table 1 报告 geometry 结果,但 Appendix D 的统计表没有列出该子集样本数。公开资料在本文核查范围内未给出一个可与主表直接对应的明确数量,因此不补猜。
实验、baseline、指标与结果
所有主任务的指标都是 accuracy,主表没有报告置信区间。数学与图算法对比无 Sketchpad 的 GPT-4 Turbo、GPT-4o,以及 Gemini-Pro、Claude 3 Opus、Mixtral 8×7B、LLaMA-2-70B。视觉任务还对比 GPT-4V-preview、LLaVA、Gemini、Claude 及此前 SOTA。单图任务进一步对照 SoM、SoM + original image 和改造后的 Visprog。
Table 1:数学、几何、图与棋局
| 模型 | Geometry | Maxflow | Isomorphism | Connectivity | Convexity | Parity | Winner ID |
|---|---|---|---|---|---|---|---|
| GPT-4 Turbo | 37.5 | 32.8 | 62.5 | 66.0 | 57.0 | 80.5 | 50.4 |
| GPT-4 Turbo + Sketchpad | 45.8 | 96.8 | 97.6 | 97.6 | 77.3 | 71.5 | 64.2 |
| 绝对变化 | +8.3 | +64.0 | +35.1 | +31.6 | +20.3 | −9.0 | +13.8 |
| GPT-4o | 62.5 | 25.0 | 50.8 | 96.1 | 87.2 | 84.4 | 61.1 |
| GPT-4o + Sketchpad | 66.7 | 66.3 | 65.3 | 98.4 | 94.9 | 94.7 | 64.6 |
| 绝对变化 | +4.2 | +41.3 | +14.5 | +2.3 | +7.7 | +10.3 | +3.5 |
解读增益高度不均匀。最大流和图结构任务受益极大,说明将数组转换成空间结构特别有效。但 GPT-4 Turbo 的 parity 下降 9.0 点,直接反驳“视觉化总能帮助”的强版本主张。论文正文说“most tasks”,比摘要中较宽泛的“all tasks”更准确。论文 Table 1
Table 2:复杂视觉推理
| 模型 | V*Bench | MMVP | Depth | Spatial | Jigsaw | Vis. Corr. | Sem. Corr. |
|---|---|---|---|---|---|---|---|
| GPT-4 Turbo | 52.5 | 71.0 | 66.1 | 68.5 | 64.7 | 48.8 | 30.9 |
| + Sketchpad | 71.0 | 73.3 | 68.5 | 80.4 | 68.5 | 52.3 | 42.4 |
| 绝对变化 | +18.5 | +2.3 | +2.4 | +11.9 | +3.8 | +3.5 | +11.5 |
| GPT-4o | 66.0 | 85.3 | 71.8 | 72.0 | 64.0 | 73.3 | 48.6 |
| + Sketchpad | 80.3 | 86.3 | 83.9 | 81.1 | 70.7 | 80.8 | 58.3 |
| 绝对变化 | +14.3 | +1.0 | +12.1 | +9.1 | +6.7 | +7.5 | +9.7 |
论文事实GPT-4o + Sketchpad 在当时报告的七项任务均达到新 SOTA。对 BLINK 五项任务,平均绝对增益为 GPT-4 Turbo 6.6 点、GPT-4o 9.0 点。论文 Table 2
Table 3:框架级对照
| 基础模型与增强 | V* | MMVP | Depth | Spatial |
|---|---|---|---|---|
| GPT-4 Turbo | 52.5 | 71.0 | 66.1 | 68.5 |
| SoM | 42.0 | 60.7 | 58.9 | 78.3 |
| SoM + orig. | 51.3 | 74.3 | 66.9 | 79.7 |
| Visprog | 33.2 | 16.3 | 67.8 | 53.8 |
| Sketchpad | 71.0 | 73.3 | 68.5 | 80.4 |
| GPT-4o | 66.0 | 85.3 | 71.8 | 72.0 |
| SoM | 49.0 | 70.7 | 62.9 | 83.2 |
| SoM + orig. | 68.1 | 84.0 | 75.0 | 82.5 |
| Visprog | 32.4 | 17.3 | 46.8 | 37.8 |
| Sketchpad | 80.3 | 86.3 | 83.9 | 81.1 |
解读Sketchpad 是唯一在这四项单图任务上对两个基础模型都保持一致提升的框架。SoM 在 Spatial 很强,但会在其他任务干扰模型。Visprog 的固定程序组合容易累积视觉模块错误。这里更支持“自适应选择和观察工具”而非“任何视觉标注都有效”。
消融与诊断
关键缺口论文没有标准组件消融
没有逐一移除 detection、segmentation、depth、crop、overlay,也没有比较零示例、六示例、不同最大轮数或不同温度。因此无法从因果上分解每个工具和 prompt 部分的贡献。
- 工具使用统计,Figure 4:V* 主要使用 detection、sliding window 与 zoom;Depth 主要调用深度估计;Spatial 主要使用 detection 与 segmentation。GPT-4o 总体调用工具更频繁。Semantic Correspondence 中 GPT-4o 使用 segmentation 的实例约 40%,而 GPT-4 Turbo 使用 detection 少于 20%,且很少用 segmentation。
- 人类计划验证:几何题上,人类与 GPT-4o 画相同辅助线的比例为 80%。视觉任务抽取每项 10 题,由 2 名受试者判断完整计划,92.8% 被评为有效。多数错误归因于视觉专家失败或简单 VQA 错误,而非计划本身。
- Oracle Sketchpad,Table 4:把 GPT-4o 最后一次 action 产生的视觉产物直接喂给 LLaVA-NeXT。LLaVA-NeXT-13B 的 Geometry 从 11.1 到 22.2,Winner ID 从 5.8 到 36.7;LLaVA-NeXT-34B 的 Maxflow 从 0.8 到 14.1,Convexity 从 81.6 到 87.1。这说明产物对别的模型也可能有价值,但不是开放模型自主规划能力的证明。
关键 Figure 与 Table 解读
| 编号 | 原图结构 | 应该读出什么 | 不能过度解读什么 |
|---|---|---|---|
| Figure 1 | 几何辅助线、函数曲线、图结构、棋盘、视觉搜索示例 | 同一思想可跨符号和自然图像任务 | 示例成功不等于平均可靠性 |
| Figure 2 | Thought、Action、Observation 闭环 | 视觉产物是下一轮上下文的一部分 | 它不是学习到的 world model |
| Figure 3 | Depth + overlay,segment/mark + crop | 工具可组合,模型可根据观察追加操作 | 未证明组合顺序最优 |
| Figure 4 | 四类视觉任务的工具调用比例 | 工具选择随任务变化,GPT-4o 更主动 | 调用频率不等于工具因果贡献 |
| Figure 5 | 函数奇偶性与多图 correspondence 轨迹 | 中间图像把抽象或局部关系外显 | 只是定性样例 |
| Table 1 | 七项数学、几何、图、棋局结果 | 结构重表达在图算法上收益最大 | Parity 存在负增益 |
| Table 2 | 七项视觉任务主结果 | 视觉搜索、深度、空间关系收益明显 | 没有方差与显著性检验 |
| Table 3 | SoM、SoM + orig.、Visprog、Sketchpad | 闭环自适应优于静态标注或固定视觉程序 | baseline 适配是否完全公平仍可讨论 |
| Table 4 | LLaVA-NeXT + oracle visual artifact | 视觉产物具有跨模型可用性 | 不是开放模型端到端 Sketchpad |
复现细节与可复现性
官方仓库公开 agent、tasks、vision_experts、示例 outputs 与轨迹查看 notebook,许可证为 Apache-2.0。数学与几何任务只需 API、AutoGen、Jupyter 及绘图库。视觉任务还需 Semantic-SAM、Grounding DINO、Depth Anything,并通过 Gradio server 暴露。官方代码仓库
| 层级 | 已公开 | 仍缺失或不稳定 |
|---|---|---|
| LLM | 具体 API snapshot、temperature 0.0、prompt、最大轮数 | 旧模型 snapshot 可用性与 API 行为漂移 |
| Agent | AutoGen 版本、parser、执行反馈、终止逻辑 | 论文主表未报告重试策略统计与异常实例处理比例 |
| 视觉专家 | 模型家族、checkpoint 获取、Gradio 接口 | 论文未报告完整硬件、显存、吞吐与各模型精确版本哈希 |
| 数据 | 预处理任务结构、部分仓库数据、外部下载链接、运行轨迹 | 外部云盘长期稳定性与 geometry 数量说明 |
| 统计 | 逐任务 accuracy 与样本数 | 无方差、置信区间、显著性检验、独立重复次数 |
推理成本
| 任务 | tokens / sample | USD / sample |
|---|---|---|
| Math Parity | 2,994 | 0.015 |
| Math Convexity | 2,211 | 0.011 |
| Graph Connectivity | 2,819 | 0.014 |
| Graph Isomorphism | 3,143 | 0.016 |
| V*Bench | 26,647 | 0.133 |
| MMVP | 11,870 | 0.059 |
| BLINK Relative Depth | 14,078 | 0.070 |
| BLINK Spatial Relation | 12,848 | 0.064 |
| BLINK Jigsaw Puzzle | 13,206 | 0.066 |
| BLINK Visual Correspondence | 16,988 | 0.085 |
| BLINK Semantic Correspondence | 11,508 | 0.058 |
这些是论文发表时基于 GPT-4o 的成本,不代表当前 API 价格。Table 7 未列 Geometry、Graph Maxflow 和 Winner ID。
复现判断
代码路径足够复现系统形态,但未必能精确复现 2024 年主表。主要原因是闭源 API snapshot 漂移、视觉专家依赖较重、版本锁定不完整,以及没有多次运行统计。更合理的目标是复现框架趋势,并用当前可固定版本的 VLM 重新建立结果。
局限、失败模式与 reviewer 式锐评
多轮 LLM 调用、图像 token、代码执行和视觉专家推理叠加。
没有训练模型学习何时 sketch、画什么、何时停止。
GPT-4 Turbo 的 parity 下降 9.0 点,SoM 也会在若干任务伤害性能。
漏检、误检或对生成图的误读会污染后续上下文。
Reviewer 式评价
强项
- 问题直觉清楚,框架简洁,跨数学与自然视觉任务验证。
- 区别于固定 visual program,智能体能在看到中间图后继续调整计划。
- 公开 prompt、代码、任务预处理和轨迹,便于研究后续工具学习。
主要质疑
- 因果归因不足:缺少工具逐项消融与轮数、示例数、原图保留策略的控制实验。
- 统计可靠性不足:只报告单一 accuracy,闭源模型又可能有运行随机性,无法判断小幅增益是否稳定。
- 比较公平性有限:Visprog 被替换部分模块,SoM 又增加了 “+ orig.” 变体,但各方法的 prompt 长度、token 成本和工具预算未统一。
- 主动纠错仅被论述:作者说模型原则上可看到错误并改计划,但没有专门测量错误检测和恢复成功率。
- 开源模型证据是 oracle:Table 4 使用 GPT-4o 生成的最后视觉产物,不能说明 LLaVA 能自己规划并画图。
- 安全边界薄弱:默认本地执行生成代码,不适合直接迁移到真实生产环境。
综合判断这是一篇强“范式展示”论文,而不是完整的学习算法论文。它证明了动态视觉上下文可提升推理,却没有证明当前工具集、计划策略或中间表示接近最优。
与程序化材质、Context Optimization、Agent 的关系
Visual Sketchpad 与程序化材质生成没有直接实验关系。下面均为迁移分析和研究建议,不应写成原论文贡献。
| 研究线 | Visual Sketchpad 提供的证据 | 迁移到程序化材质生成 |
|---|---|---|
| Procedural Material Generation | 把难以语言化的密集视觉结构转成可观察中间产物 | 将参考图像分解为全局布局、材料区域、频率层级、边界、法线与粗糙度线索,再生成程序化材质图 |
| Context Optimization | 上下文不是静态 prompt,而是由工具产生并随轮次更新的视觉表示 | 让 Context Optimizer 选择 crop、mask、频谱、尺度标尺、tile 检测和通道估计,形成 \(C^{\ast}\) |
| Agent | 模型自主决定工具调用,观察结果后修改下一步计划 | 让 Agent 生成节点图、执行 renderer、比较 \(\hat I\) 与 \(I\),再修订结构和参数 |
统一研究框架
研究框架这不是 Visual Sketchpad 原始贡献
Visual Sketchpad 对应的是第一段与第二段之间的接口设计思想:把 \(C^{\ast}\) 做成模型能直接观察和继续操作的视觉工作区。当前课题还需要加入 renderer-in-the-loop 的渲染反馈与对程序化材质图 \(G\) 的结构约束。
多尺度材质视觉上下文
哪些视觉产物最值得迁移
- mask + marks:把材质中的语义或结构区域离散成可引用对象,例如水泥基底、骨料、裂缝、污渍。marks 让模型能在文本轨迹中稳定指向某一区域。
- multi-scale crops:分别提供整体周期、中尺度 motif 和微表面统计,减少单一缩放下的尺度混淆。
- lines 与 orientation field:用于木纹、拉丝金属、纤维、划痕和层理的主方向表达。
- frequency sketch:增加频谱图、带通分解或局部自相关图,帮助匹配 procedural noise 的频率和 octave。
- render overlays:把参考图、当前渲染、差异热图和边缘图组合,使 Agent 能定位结构错误与参数错误。
对当前课题的具体实验议程
最有发表价值的问题不是“加几个视觉工具是否更好”,而是研究哪一种 context representation 能让材质 Agent 更高效、更可靠地搜索程序化材质图。
可检验假设
H1:多尺度上下文优于单图上下文
将参考图像分解为 global、meso、micro 三个尺度的结构化视觉上下文,会提高材质结构召回并减少错误节点类型。
H2:自适应上下文优于固定上下文
Agent 根据当前渲染失败模式主动请求 mask、crop、frequency 或 channel estimate,比预先固定提供全部上下文更节省 token 与工具成本。
H3:渲染差异驱动的视觉草图支持自修复
将差异热图、边缘差异和尺度分解差异写回上下文,可提高拓扑修订成功率,而不只是连续参数优化。
最小可发表实验矩阵
| 组别 | 上下文 | Agent 闭环 | 要回答的问题 |
|---|---|---|---|
| A | 原始参考图像 | 无工具 | 基础 VLM 直接生成程序化材质图的能力 |
| B | 原图 + 固定文本分解 | 无工具 | prompt engineering 的增益 |
| C | 原图 + 固定多尺度 crops / masks | 无自适应调用 | 静态 context optimization 的增益 |
| D | Agent 自选视觉工具 | 有,未使用 renderer | Visual Sketchpad 式动态上下文的增益 |
| E | Agent 自选视觉工具 + 渲染差异 | 完整 renderer-in-the-loop | 渲染反馈是否改善结构和参数 |
| F | Oracle 上下文 | 固定 | 上下文表示的性能上界与 Agent 选择差距 |
评价指标
研究建议需要把最终图像相似度与图结构质量同时评估。仅优化像素或 CLIP 相似度可能得到视觉相近但不可编辑、不可泛化或依赖 bitmap 的伪程序化解。
必须补上的 Visual Sketchpad 缺失实验
- 逐工具消融:mask、crop、frequency、orientation、channel estimate、difference map。
- 固定预算:统一最大工具次数、render 次数、token 和时间,比较静态与动态上下文。
- 错误注入:人为制造错 mask、错尺度和错渲染,测量 Agent 的发现率、恢复率与额外成本。
- 跨材质类别泛化:规则纹理、随机颗粒、分层结构、有方向纹理、非平稳污渍分别报告。
- 结构与参数分离:先评估节点拓扑,再评估参数搜索,避免最终 render 指标掩盖图结构错误。
References
- Hu, Y. et al. Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models. arXiv:2406.09403v3, 2024.
- Hu, Y. et al. Visual Sketchpad full paper and appendices. 32 pages, version dated 2024-11-11.
- Visual Sketchpad authors. Official project page. Project overview, examples and headline results.
- Yushi-Hu. VisualSketchpad official repository. Agent, tasks, outputs, vision experts and Apache-2.0 license.
- VisualSketchpad repository. agent/config.py. Model configuration, temperature, maximum replies and service addresses.
- VisualSketchpad repository. agent/prompt.py. Tool documentation, in-context examples and task prompts.
- VisualSketchpad repository. agent/execution.py. Local Jupyter execution and image result processing.
- VisualSketchpad repository. agent/tools.py. Detection, segmentation, depth, crop, sliding window and overlay implementations.
- VisualSketchpad repository. vision_experts/installation.md. Semantic-SAM, Grounding DINO and Depth Anything installation.
- Kirillov, A. et al. Segment Anything. ICCV 2023.
- Li, F. et al. Semantic-SAM: Segment and Recognize Anything at Any Granularity. 2023.
- Liu, S. et al. Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection. 2023.
- Yang, L. et al. Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data. CVPR 2024.
- Yang, J. et al. Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V. 2023.
- Fu, X. et al. BLINK: Multimodal Large Language Models Can See but Not Perceive. 2024.
- Wu, P. and Xie, S. V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs. 2023.
- Yao, S. et al. ReAct: Synergizing Reasoning and Acting in Language Models. 2022.
- Wu, Q. et al. AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. 2023.
证据标签说明
论文事实可由论文或官方代码直接支持。分析判断是基于证据的解释。研究框架是面向程序化材质课题的延伸。未报告表示公开资料不足,未补造数值。