中文

黑暗中的推理:潜在空间中的交错视觉文本推理

计算机视觉与模式识别 2026-01-29 v2 人工智能 计算与语言

摘要

多模态推理旨在通过在到达最终答案之前引入中间推理步骤来增强大语言模型的能力。它从文本唯一推理演变为整合视觉信息,使思考过程能够通过图像和文本两种方式表达。尽管此方法有效,但当前的多模态推理方法依赖于需要耗时的视觉文本标注的显式推理步骤,本质上引入了显著的推理延迟。为解决这些问题,我们引入了具备多模态表示、减少标注和推理效率优势的多模态潜在推理。为实现此目标,我们提出了交错视觉文本潜在推理(IVT-LR)方法,在潜在空间中的推理过程中注入视觉和文本信息。具体而言,IVT-LR通过结合两个隐式部分来表示每个推理步骤:潜在文本(来自前一步的隐藏状态)和潜在视觉(一组选定的图像嵌入)。我们进一步引入了分阶段训练策略,以使 MLLMs 能够执行上述多模态潜在推理步骤。在 M3^3CoT 和 ScienceQA 上的实验表明,我们的 IVT-LR 方法在准确率上平均提升 5.45%,同时实现了与现有方法相比的速度提升超过 5 倍。

关键词

引用

@article{arxiv.2510.12603,
  title  = {Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space},
  author = {Chao Chen and Zhixin Ma and Yongqi Li and Yupeng Hu and Yinwei Wei and Wenjie Li and Liqiang Nie},
  journal= {arXiv preprint arXiv:2510.12603},
  year   = {2026}
}