用于视觉语言模型中潜在空间推理的多模态连续思维链
计算机视觉与模式识别
2025-09-25 v2
摘要
许多大型多模态模型的推理技术会采纳语言模型方法,如 Chain-of-Thought (CoT) 提示,这些方法将推理表述为词序列。虽然对文本有效,但这些方法在多模态情境下次优,难以在音频、视觉和文本信息之间进行动态对齐。为探索替代范式,我们提出了多模态连续思维链 (Multimodal Chain of Continuous Thought, MCOUT),其使推理直接在联合潜在空间中进行,而非自然语言中。在 MCOUT 中,推理状态表示为连续隐藏向量,迭代细化并与视觉和文本嵌入对齐,灵感来自人类反思性认知。我们开发了两个变体:MCOUT-Base 重用语言模型的最后隐藏状态作为连续思维进行迭代推理,MCOUT-Multi 集成多模态潜在注意力以加强视觉和文本特征之间的跨模态对齐。实验在包括 MMMU、ScienceQA 和 MMStar 在内的基准数据集上显示,MCOUT 在多模态推理方面 consistently 提升,使准确率在强基准上提升最高可达 8.23%,BLEU 分数在多个选择题和开放题任务中提升最高可达 8.27%。这些发现突显了潜在连续推理作为超越语言绑定 CoT 的有前景方向,为人类式反思性多模态推断提供了可扩展框架。代码可在 https://github.com/Hanhpt23/OmniMod 查看。
引用
@article{arxiv.2508.12587,
title = {Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models},
author = {Tan-Hanh Pham and Chris Ngo},
journal= {arXiv preprint arXiv:2508.12587},
year = {2025}
}