跨模态冲突下大型多模态模型推理一致性分析
计算机视觉与模式识别
2026-01-08 v1 人工智能
计算与语言
摘要
大型多模态模型通过思维链在视频推理中展现了令人印象深刻的能力。然而,其推理链的鲁棒性仍然存疑。在本文中,我们识别出一个关键的失效模式,称为文本惯性,即一旦思考过程中出现文本幻觉,模型倾向于盲目地坚持错误文本,而忽略冲突的视觉证据。为了系统地研究这一点,我们提出了逻辑图扰动协议,该协议结构性地向不同大型多模态模型的推理链中注入扰动,涵盖原生推理架构和提示驱动范式,以评估其自我反思能力。结果表明,模型在不到10%的情况下成功自我纠正,并且主要屈从于盲目的文本错误传播。为了缓解这一问题,我们引入了主动视觉上下文精炼,这是一种无需训练的推理范式,它编排了一个主动的视觉重新定位机制以强制执行细粒度验证,并结合一个自适应上下文精炼策略来总结和去噪推理历史。实验表明,我们的方法显著抑制了幻觉传播并增强了推理鲁棒性。
引用
@article{arxiv.2601.04073,
title = {Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts},
author = {Zhihao Zhu and Jiafeng Liang and Shixin Jiang and Jinlan Fu and Ming Liu and Guanglu Sun and See-Kiong Ng and Bing Qin},
journal= {arXiv preprint arXiv:2601.04073},
year = {2026}
}
备注
10 pages, 5 figures