别让视频说话:基于音频对比的音视频语言模型偏好优化
计算机视觉与模式识别
2026-04-16 v1
摘要
尽管音视频语言模型(AVLMs)在近年来取得了显著进展,但其可靠性受限于跨模态幻觉。一种尤其普遍的表现是视频驱动的音频幻觉:模型常常利用视觉线索来幻觉生成预期声音,忽略真实的听觉证据。为抵消这种根深蒂固的视觉主导地位,我们提出音频对比偏好优化(ACPO)。该方法引入输出对比目标以惩罚伪装成音频事实的视觉描述,同时引入输入对比目标,通过交换音频轨道来显式惩罚对真实听觉信号不变的生成。大量实验表明,ACPO建立了高度可靠的音频 grounding,同时缓解了音频幻觉,而不损害整体多模态能力。
引用
@article{arxiv.2604.14129,
title = {Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models},
author = {Ami Baid and Zihui Xue and Kristen Grauman},
journal= {arXiv preprint arXiv:2604.14129},
year = {2026}
}
备注
Project page: https://vision.cs.utexas.edu/projects/acpo/