中文

推理动力学及其在视觉-语言模型中监控模态依赖性的极限

计算与语言 2026-04-28 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

近期视觉-语言模型(VLM)的进展提供了推理能力,但这些推理如何展开且如何整合视觉与文本信息仍不清晰。我们分析了18个VLM的推理动力学,这些模型涵盖指令调优模型和推理训练模型,来自两个不同的模型家族。我们跟踪链路思考(Chain-of-Thought, CoT)中的置信水平,衡量推理的纠正效果,评估中间推理步骤的贡献。我们发现模型容易产生答案惯性,即对早期预测决定的强化,而非在推理步骤中得到修正。尽管推理训练的模型显示出更强的纠正行为,但其收益取决于模态条件,从文本为主到仅视觉设置。通过对包含误导性文本线索的受控干预,我们展示了即使在视觉证据充足时,模型仍一致受到这些线索的影响,并评估这种影响是否可从CoT中检测到。尽管这种影响可能出现在CoT中,但其可检测性在不同模型之间且取决于所监控内容。推理训练的模型更可能显式地引用这些线索,但其更长且更流畅的CoT仍可能看起来是视觉导向的,实际上遵循文本线索,从而掩盖了模态依赖性。相比之下,指令调优模型更少显式地引用这些线索,但其较短的痕迹揭示了与视觉输入不一致之处。综上所述,这些发现表明,CoT仅提供了不同模态驱动VLM决策的部分视图,对多模态系统的透明度和安全性具有重要含义。

关键词

引用

@article{arxiv.2604.14888,
  title  = {Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models},
  author = {Danae Sánchez Villegas and Samuel Lewis-Lim and Nikolaos Aletras and Desmond Elliott},
  journal= {arXiv preprint arXiv:2604.14888},
  year   = {2026}
}