看见与相信:评估开源多模态大语言模型在反直觉场景中的语言偏差
计算机视觉与模式识别
2026-05-27 v2 人工智能
摘要
多模态大语言模型(MLLMs)在主流视觉理解任务中展现出惊人的性能,但其处理与日常常识相矛盾的行动场景的能力仍未得到充分测试。为填补这一空白,我们引入了 CAIT 数据集,包含 400 个高保真合成场景,聚焦于反直觉的视觉动作,如“一只兔子正在追逐老虎”,其中视觉证据明确与常识期望相矛盾。我们评估了人类、主要专有模型(如 Claude 和 Gemini),以及 14 个代表性开源 MLLMs。人类实现了近乎完美的性能(约 0.95 的准确率),而专有模型显示出鲁棒的理解能力(最高达到 0.88 的准确率),而标准的开源指令调优模型表现停留在随机水平。进一步分析表明,这一失败是由强烈的语言先验驱动的:这些模型并不信任视觉输入,而是自动地将异常视觉信号覆盖为统计上常见的文本描述。虽然引入链式思考(Chain-of-Thought)推理机制可以提高准确率,但显著降低了响应速度,并产生了新的失败模式:模型过度思考情景,因违反现实物理法则而拒绝接受实际视觉内容。最后,我们展示了针对性微调和结构化提示可以有效缓解这种对语言先验的依赖,使开源模型能够准确地将推理锚定在实际视觉证据上。
引用
@article{arxiv.2601.07737,
title = {Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes},
author = {Chen Ling and Tongwei Zhang and Hanqian Li and Nai Ding},
journal= {arXiv preprint arXiv:2601.07737},
year = {2026}
}