中文

视觉思维:理解多模态思维链的统一视角

计算机视觉与模式识别 2025-10-28 v2 计算与语言

摘要

大型视觉语言模型(LVLMs)在多模态任务中取得了显著成功,多模态思维链(MCoT)进一步增强了性能和可解释性。近期的MCoT方法分为两类:(i) 文本MCoT(T-MCoT),接收多模态输入并产生文本输出;(ii) 交错MCoT(I-MCoT),生成交错的图像-文本输出。尽管两种方法都取得了进展,但推动这些改进的机制尚未被充分理解。为了填补这一空白,我们首先揭示了MCoT通过引入视觉思维来增强LVLMs,视觉思维将图像信息传递给推理过程,而无论MCoT格式如何,仅取决于表达的清晰性和简洁性。此外,为了系统地探索视觉思维,我们定义了四种不同的视觉思维表达形式并进行了全面分析。我们的发现表明,这些形式在清晰性和简洁性上存在差异,从而产生不同程度的MCoT提升。此外,我们探索了视觉思维的内在本质,发现视觉思维充当输入图像与推理至更深层Transformer层之间的中介,使更先进的视觉信息传递成为可能。我们希望视觉思维能够激发未来MCoT研究的进一步突破。

关键词

引用

@article{arxiv.2505.15510,
  title  = {Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought},
  author = {Zihui Cheng and Qiguang Chen and Xiao Xu and Jiaqi Wang and Weiyun Wang and Hao Fei and Yidong Wang and Alex Jinpeng Wang and Zhi Chen and Wanxiang Che and Libo Qin},
  journal= {arXiv preprint arXiv:2505.15510},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025;