中文

组合与融合:重新审视多模态推理的根本性瓶颈

计算与语言 2026-05-01 v4 人工智能

摘要

多模态大语言模型(MLLMs)承诺通过整合文本、视觉和音频等多样化输入来增强推理能力。然而,跨模态推理仍未得到充分探索,有报告称添加模态有助或损害性能。这些不一致性源于缺乏受控的评估框架以及对模型内部运行机制的分析,无法孤立地确定何时何地模态交互有助于或削弱推理。我们通过一个以逻辑为基础的评估框架来解决这一问题,将多模态推理分为六种交互模式,具体取决于事实在不同模态中的分布方式以及逻辑组合方式。实证结果表明,只有当额外模态提供独立且充分的推理路径时,才会提升推理效果;而冗余或链式演绎支持往往会损害性能。此外,推理在三个系统性方式下会下降:较弱的模态会拖累整体表现、冲突会偏向某些模态、以及来自不同模态的联合信号未能有效集成。因此,我们确定了两个核心失效:任务组合瓶颈——即识别与推理无法在单一步骤中联合执行;以及融合瓶颈——即早期集成引入偏差。进一步的调查发现,注意力模式未能编码事实的有效性,但一种简单的两步提示(先识别后推理)能够恢复性能,确认了任务组合瓶颈。此外,模态身份在早期层次中仍可被恢复,软化早期融合的注意力有助于推理,从而凸显偏向性融合作为另一种失效模式。总体而言,我们的发现表明,整合而非感知,是多模态推理的主要障碍,提示需要关注任务组合的训练和早期融合控制作为有前景的方向。

关键词

引用

@article{arxiv.2509.23744,
  title  = {Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning},
  author = {Yucheng Wang and Yifan Hou and Aydin Javadov and Mubashara Akhtar and Mrinmaya Sachan},
  journal= {arXiv preprint arXiv:2509.23744},
  year   = {2026}
}

备注

Our code (https://github.com/DELTA-DoubleWise/OmniReason) and data (https://huggingface.co/datasets/ycwang11/OmniReason) are publicly available