中文

当视觉为声音说话

计算机视觉与模式识别 2026-05-19 v1 声音

摘要

尽管视频能力突破的 MLLMs 取得了快速进展,但我们发现,这些模型在视频中的听觉理解往往是基于视觉驱动的:模型依赖视觉线索来推断或幻觉声学信息,而非验证音频流是否真实存在。这一问题同时出现在开源的全能模型和来自 Google、OpenAI 等提供商的领先闭源模型中。我们将这种失效模式称为音频-视觉“聪明汉”效应,模型看似(错误地)与音频对齐,却实际上利用视觉-声学关联性,而未验证音频和视觉流是否真实一致。为系统性地研究此行为,我们引入 Thud,一个基于三种反事实音频编辑的干预驱动探针框架:Shift 测试时间同步,Mute 测试声音是否存在,Swap 测试音频-视觉一致性。除了诊断外,我们进一步研究了两种阶段的对齐方案:干预派生的偏好对学习音频验证,而事件级通用视频偏好则正则化模型以防止过度专化。我们的最佳 10K 样本配方在三个干预维度上平均提升 28 个百分点,同时在通用视频和音频-视觉 QA 基准上略有提升。

关键词

引用

@article{arxiv.2605.16403,
  title  = {When Vision Speaks for Sound},
  author = {Xiaofei Wen and Wenjie Jacky Mo and Xingyu Fu and Rui Cai and Tinghui Zhu and Wendi Li and Yanan Xie and Muhao Chen and Peng Qi},
  journal= {arXiv preprint arXiv:2605.16403},
  year   = {2026}
}

备注

24 pages, 10 figures