中文

大型音频语言模型真的能听懂吗?基于多任务评估与逐步音频推理消除幻觉

音频与语音处理 2025-01-03 v2 计算与语言 声音

摘要

近期发展表明,大型音频语言模型(LALMs)在理解和推理音频和语音信息方面具有令人印象的能力。然而,这些模型仍面临挑战,包括幻听不存在的声音事件、误判声音事件的顺序以及错误地归因声音来源,这些问题削弱了其可靠性和实际应用。为系统评估这些问题,我们提出了三个独立的任务:对象存在、时间顺序和对象属性,涉及音频。这些任务评估了模型对关键音频信息方面的理解。我们的实验结果揭示了这些基础任务中的局限性,凸显了在识别特定声音事件、确定事件序列和识别声音来源方面亟需更好的模型。为提高这些领域的性能,我们引入了一种多轮链式思考方法,显著改善了该提出任务中的模型性能。

关键词

引用

@article{arxiv.2410.16130,
  title  = {Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning},
  author = {Chun-Yi Kuan and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2410.16130},
  year   = {2025}
}

备注

Accepted to ICASSP 2025. Project Website: https://github.com/kuan2jiu99/audio-hallucination