推理动力学及其在视觉-语言模型中监控模态依赖性的极限
计算与语言
2026-04-28 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
近期视觉-语言模型(VLM)的进展提供了推理能力,但这些推理如何展开且如何整合视觉与文本信息仍不清晰。我们分析了18个VLM的推理动力学,这些模型涵盖指令调优模型和推理训练模型,来自两个不同的模型家族。我们跟踪链路思考(Chain-of-Thought, CoT)中的置信水平,衡量推理的纠正效果,评估中间推理步骤的贡献。我们发现模型容易产生答案惯性,即对早期预测决定的强化,而非在推理步骤中得到修正。尽管推理训练的模型显示出更强的纠正行为,但其收益取决于模态条件,从文本为主到仅视觉设置。通过对包含误导性文本线索的受控干预,我们展示了即使在视觉证据充足时,模型仍一致受到这些线索的影响,并评估这种影响是否可从CoT中检测到。尽管这种影响可能出现在CoT中,但其可检测性在不同模型之间且取决于所监控内容。推理训练的模型更可能显式地引用这些线索,但其更长且更流畅的CoT仍可能看起来是视觉导向的,实际上遵循文本线索,从而掩盖了模态依赖性。相比之下,指令调优模型更少显式地引用这些线索,但其较短的痕迹揭示了与视觉输入不一致之处。综上所述,这些发现表明,CoT仅提供了不同模态驱动VLM决策的部分视图,对多模态系统的透明度和安全性具有重要含义。
引用
@article{arxiv.2604.14888,
title = {Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models},
author = {Danae Sánchez Villegas and Samuel Lewis-Lim and Nikolaos Aletras and Desmond Elliott},
journal= {arXiv preprint arXiv:2604.14888},
year = {2026}
}