感知关闭:全模态大语言模型中的表示-行动鸿沟
人工智能
2026-05-14 v1 计算与语言
摘要
当全模态大语言模型接受一个其文本前提与其实际看到的或听到的内容相矛盾的问题时,失败是感知问题还是行动问题?近期的全模态模型被定位为能够联合处理视频、音频和文本的感知 grounding 代理,但仍未进行基础测试:捕捉与模型自身感官输入相矛盾的文本主张。我们引入 IMAVB,这是一个包含 500 段电影影片的精选基准测试,其 2x2 设计交叉了目标模态 (视觉、音频) 与前提条件 (标准、误导),从而能够单独衡量冲突检测而不影响普通的多模态理解。在八个开源全模态大语言模型和 Gemini 3.1 Pro 上,我们记录了表示-行动鸿沟:隐藏状态可靠地编码前提-感知不匹配,即便是相同的模型几乎从不在其输出中拒绝虚假主张。行为上,模型会出现两种失败模式:低 rejection,即它们会像虚假前提为真一样回答误导问题;以及高 rejection,即它们拒绝得更频繁,但也会拒绝标准问题,牺牲了普通理解准确性。该鸿沟具有模态非对称性 (音频 grounding 表现不如视觉),且对七种变体均不易通过提示词实现克服。作为初始诊断干预,我们提出了一种探针引导的逻辑调整 (PGLA) 方法,将编码的冲突信号重新注入解码,从而在 consistently 改善 rejection 行为。总体而言,这些结果表明,全模态 grounding 的瓶颈在于翻译,而非感知。
引用
@article{arxiv.2605.13737,
title = {Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs},
author = {Trung Nguyen Quang and Yiming Gao and Fanyi Pu and Kaichen Zhang and Shuo Sun and Ziwei Liu},
journal= {arXiv preprint arXiv:2605.13737},
year = {2026}
}