如何进行视觉思考?统一多模态模型中交叉视图空间推理的视觉思考
计算机视觉与模式识别
2026-05-27 v1
摘要
跨视图空间推理是视觉语言模型(VLMs)的薄弱环节:它们往往仅依据语言推理,丢失了完成任务所需的细粒度几何信息。以图像进行思考旨在通过生成中间思考图像来解决此问题,但近期研究表明,这些图像常常被忽略。我们因此提出如何让视觉思考发挥作用,以及哪种类型的视觉思考最为有效。我们研究这些问题于统一多模态模型(UMMs),其原生支持图像-文本交替生成。针对第一个问题,我们提出View Dropout(VDrop),这是一种训练时干预措施:隐藏输入视图的部分内容于答案范围之外,同时保持其对思考图像标记可见。这鼓励模型在作答时使用思考图像,而非仅依赖输入视图。一旦思考图像被用于答案预测,我们进一步研究哪种类型的视觉思考最为有效。我们将其建模为可学习性与信息性之间的权衡,并比较三种思考图像变体:顶层、全景和点匹配渲染。经过在合成场景上训练,在五个真实世界的跨域基准测试上进行评估,全景视觉思考配合VDrop是唯一既信息丰富又可学习的配置,能够实现最佳的跨域泛化。
引用
@article{arxiv.2605.27310,
title = {How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning},
author = {Qian Yang and Ankur Sikarwar and Huy Le and Le Zhang and Zhuan Shi and Perouz Taslakian and Aishwarya Agrawal},
journal= {arXiv preprint arXiv:2605.27310},
year = {2026}
}
备注
Preprint