中文

当音频与文本相悖:揭示大型音频-语言模型中的文本偏差

计算与语言 2025-08-22 v1 人工智能

摘要

大型音频-语言模型(LALMs)增强了音频感知能力,使其能够有效处理和理解结合了音频与文本的多模态输入。然而,它们在处理音频和文本模态间冲突信息时的表现,在很大程度上仍未得到检验。本文引入了MCR-BENCH,这是首个专门设计用于评估LALMs在接收到不一致的音频-文本对时如何优先处理信息的综合基准。通过对多种音频理解任务的广泛评估,我们揭示了一个令人担忧的现象:当模态间存在不一致时,LALMs表现出对文本输入的显著偏差,常常忽略音频证据。这种倾向导致在以音频为中心的任务中性能大幅下降,并为实际应用带来了重要的可靠性问题。我们进一步研究了文本偏差的影响因素,探索了通过监督微调的缓解策略,并分析了模型置信度模式,揭示了即使在输入矛盾的情况下模型也持续过度自信。这些发现强调了在训练过程中改善模态平衡以及开发更复杂的融合机制以增强处理冲突多模态输入时鲁棒性的必要性。该项目可在 https://github.com/WangCheng0116/MCR-BENCH 获取。

关键词

引用

@article{arxiv.2508.15407,
  title  = {When Audio and Text Disagree: Revealing Text Bias in Large Audio-Language Models},
  author = {Cheng Wang and Gelei Deng and Xianglin Yang and Han Qiu and Tianwei Zhang},
  journal= {arXiv preprint arXiv:2508.15407},
  year   = {2025}
}

备注

Accepted by EMNLP 2025 Main