中文

听懂声音、漏掉问题:大型音频语言模型中对象幻觉的挑战

音频与语音处理 2024-06-13 v1 计算与语言 机器学习 声音

摘要

大型音频语言模型(LALMs)通过整合音频感知能力来增强传统大型语言模型,使其能够处理与音频相关的任务。以往的研究主要聚焦于评估 LALMs 在各种任务上的性能,却忽略了其可靠性,尤其是关于对象幻觉等问题。我们在本研究中引入了方法来评估公开可用的 LALMs 对象幻觉的程度。我们的发现表明,LALMs 在理解音频内容方面相当于专门的音频描述模型,但在回答需要识别特定对象声音是否存在于音频剪辑中的判别性问题方面存在挑战。这一局限性凸显了当前 LALMs 的关键弱点:其对判别性查询的理解不足。此外,我们探讨了通过 prompt engineering 来提高 LALMs 在判别性问题上的性能。

关键词

引用

@article{arxiv.2406.08402,
  title  = {Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models},
  author = {Chun-Yi Kuan and Wei-Ping Huang and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2406.08402},
  year   = {2024}
}

备注

Accepted to Interspeech 2024