中文

教会音频感知大语言模型未闻之音:通过合成负样本缓解幻觉

音频与语音处理 2025-07-02 v2 计算与语言 声音

摘要

音频感知大语言模型 (ALLMs) 的最新进展使其能够处理和理解音频输入。然而,这些模型经常会产生不存在的声音事件的幻觉,降低了它们在实际应用中的可靠性。为了解决这个问题,我们提出了 LISTEN(Learning to Identify Sounds Through Extended Negative Samples,通过扩展负样本学习识别声音),这是一种类似对比训练的方法,利用来自骨干 LLM 的合成数据来增强 ALLMs 区分存在与不存在声音的能力。与以往的方法不同,我们的方法不需要修改 LLM 参数,并通过轻量级适配器高效集成音频表示。实验表明,LISTEN 在有效缓解幻觉的同时,在现有的音频问答与推理基准上保持了出色的性能。同时,它在数据和计算方面都更加高效。

关键词

引用

@article{arxiv.2505.14518,
  title  = {Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples},
  author = {Chun-Yi Kuan and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2505.14518},
  year   = {2025}
}

备注

Accepted to Interspeech 2025. Project Website: https://kuan2jiu99.github.io/Balsa