Visual Sketchpad:多模态语言模型的可视化思维链绘图
计算机视觉与模式识别
2024-11-12 v3 计算与语言
摘要
人类会通过绘图来促进推理:解几何问题时画辅助线;阅读地图时标注和画圆;使用草图来放大想法,减轻工作记忆的限制。然而,这些行为在当前多模态语言模型(LM)中缺失。当前的链式思维和工具使用范式仅使用文本作为中间推理步骤。本文引入 Sketchpad 框架,为多模态 LM 提供可视化草图板和绘图工具。LM 根据所绘制的视觉痕迹进行计划和推理。与先前工作不同,Sketchpad 使 LM 能够绘制线条、框选、标记等,更贴近人类绘图方式,更有效地促进推理。Sketchpad 还能在绘图过程中调用专家视觉模型(例如,用目标检测模型绘制边界框,用分割模型绘制掩码),进一步提升视觉感知与推理能力。我们在广泛的数学任务(包括几何、函数、图形和棋局)和复杂视觉推理任务上进行实验。Sketchpad 在所有任务上均显著优于无绘图的强大基线模型,数学任务平均提升 12.7%,视觉任务提升 8.6%。搭载 Sketchpad 的 GPT-4o 在所有任务中均达到新型态,包括 V*Bench(80.3%)、BLINK 空间推理(83.9%)和视觉对应(80.8%)。所有代码与数据已公开于 https://visualsketchpad.github.io/。
引用
@article{arxiv.2406.09403,
title = {Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models},
author = {Yushi Hu and Weijia Shi and Xingyu Fu and Dan Roth and Mari Ostendorf and Luke Zettlemoyer and Noah A Smith and Ranjay Krishna},
journal= {arXiv preprint arXiv:2406.09403},
year = {2024}
}
备注
Accepted to NeurIPS 2024. Project and codes url: https://visualsketchpad.github.io/