音频-视觉大语言模型真的在看和听吗?
人工智能
2026-04-06 v1 声音
摘要
音频-视觉大语言模型(AVLLMs)正作为多模态感知的统一接口涌现。我们对 AVLLMs 进行了首个机制可解释性研究,分析音频和视觉特征如何在 AVLLM 的不同层中演化和融合以产生最终文本输出。我们发现虽然 AVLLMs 在中间层编码了丰富的音频语义,但这些能力在音频与视觉冲突时很大程度上未能在最终文本生成中体现。探测分析表明有用的潜在音频信息是存在的,但更深的融合层不成比例地偏重视觉表示,从而倾向于抑制音频线索。我们进一步将这种不平衡追溯到训练:AVLLM 的音频行为与其视觉-语言基础模型高度一致,表明对音频监督的额外对齐有限。我们的发现揭示了 AVLLMs 中一种根本性的模态偏见,并为多模态 LLM 如何整合音频和视觉提供了新的机制性见解。
引用
@article{arxiv.2604.02605,
title = {Do Audio-Visual Large Language Models Really See and Hear?},
author = {Ramaneswaran Selvakumar and Kaousheik Jayakumar and S Sakshi and Sreyan Ghosh and Ruohan Gao and Dinesh Manocha},
journal= {arXiv preprint arXiv:2604.02605},
year = {2026}
}
备注
CVPR Findings