潜在草稿纸:为 MLLMs 绘示以激发多模态推理
计算机视觉与模式识别
2025-10-29 v1 计算与语言
摘要
虽然多模态大语言模型 (MLLM) 在视觉理解方面表现出色,但在需要视觉规划和想象的复杂场景中常常力不从心。鼓励人类通过绘图作为视觉思考形式来发展和表达想法的能力,启发我们引入 Latent Sketchpad 框架,为 MLLMs 提供内部视觉草稿纸。过去,MLLM 的内部视觉表示局限于感知理解。我们将其重新定位以支持生成视觉思想,而不损害推理能力。基于前沿 MLLM,我们的方法将视觉生成直接集成到其原生自回归推理过程中。它允许模型在文本推理与视觉 latents 生成之间交替进行。这些 latents 指导内部思考过程,并可转换为草图图像以实现可解释性。为实现此目标,我们引入了两个组件:Context-Aware Vision Head 自回归地产生视觉表示,预训练的 Sketch Decoder 将其渲染为人类可解释的图像。我们在新的 MazePlanning 数据集上评估了该框架。实验表明,Latent Sketchpad 在各种 MLLM 上均能实现与其 backbone 相当甚至更好的推理性能。它还能在不同的前沿 MLLM 之间普遍化,包括 Gemma3 和 Qwen2.5-VL。通过将模型的文本推理扩展为视觉思考,本框架为更丰富的人机交互和更广泛的应用开辟了新机遇。更多细节和资源请访问我们的项目页面:https://latent-sketchpad.github.io/。
引用
@article{arxiv.2510.24514,
title = {Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs},
author = {Huanyu Zhang and Wenshan Wu and Chengzu Li and Ning Shang and Yan Xia and Yangyu Huang and Yifan Zhang and Li Dong and Zhang Zhang and Liang Wang and Tieniu Tan and Furu Wei},
journal= {arXiv preprint arXiv:2510.24514},
year = {2025}
}