探索以观察为中心视频理解中的音频幻觉
计算机视觉与模式识别
2026-04-28 v1 人工智能
摘要
以观察为中心的视频提供了一种独特的场景,在此场景下,声音作为理解用户活动和周围环境的关键线索,尤其在视觉信息因持续的相机移动而不稳定或遮挡时发挥着至关作用。最先进的大型音视频语言模型(AV-LLM)能够生成多模态描述。然而,我们在本工作中表明,这些模型容易产生音频幻觉,常常会从可见但未被听见的视觉线索中推断出声音。我们提出了一个系统且自动的评估框架,用于分析以观察为中心的视频中的音频幻觉,通过针对性的问答(Q/A)协议进行评估。我们收集了 300 个以观察为中心的视频数据集,并设计了 1000 个聚焦声音的问答问题以探测模型输出。为刻画幻觉现象,我们提出了一种基于 grounding 的分类法,将其区分为来自用户活动的前景动作声音与背景环境声音。我们的评估显示,先进的 AV-LLM 如 Qwen2.5 Omni 在前景和背景声音相关的问答方面的幻觉率很高,分别只有 27.3% 和 39.5% 的准确率。通过本工作,我们强调了需要衡量多模态响应可靠性的重要性,强调对幻觉的稳健评估对于开发可靠的 AV-LLM 至关重要。
引用
@article{arxiv.2604.23860,
title = {Exploring Audio Hallucination in Egocentric Video Understanding},
author = {Ashish Seth and Xinhao Mei and Changsheng Zhao and Varun Nagaraja and Ernie Chang and Gregory P. Meyer and Gael Le Lan and Yunyang Xiong and Vikas Chandra and Yangyang Shi and Dinesh Manocha and Zhipeng Cai},
journal= {arXiv preprint arXiv:2604.23860},
year = {2026}
}
备注
Accepted to ICASSP 2026