中文

HalluAudio:面向大型音频语言模型的幻觉检测综合基准

声音 2026-04-22 v1 人工智能

摘要

大型音频语言模型(Large Audio-Language Models, LALMs)近期在 various audio-centric tasks 上取得了显著性能。然而,幻觉现象——即模型生成语义不正确或声学不被支持的响应——在音频领域仍鲁有探讨。现有幻觉基准主要聚焦于文本或视觉领域,而少数针对音频的研究在规模、模态覆盖和诊断深度方面有限。因此,我们引入HalluAudio,首个面向语音、环境声和音乐的大规模幻觉评估基准。HalluAudio包含超过5000个人工验证的问答对,涵盖二元判断、多选推理、属性验证和开放式问答等多样任务类型。为系统性诱导幻觉,我们设计了对抗性提示和混合音频条件。除准确率外,我们的评估协议衡量幻觉率、肯定/否定偏置、错误类型分析以及拒绝率,从而对LALMs的 failure 模式进行细粒度分析。我们对广泛的开源和专有模型进行基准测试,首次实现语音、声音和音乐的大规模对比。结果揭示了声学 grounding、时序推理和音乐属性理解方面的显著不足,凸显了构建可靠可鲁棒LALMs的必要性。

关键词

引用

@article{arxiv.2604.19300,
  title  = {HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models},
  author = {Feiyu Zhao and Yiming Chen and Wenhuan Lu and Daipeng Zhang and Xianghu Yue and Jianguo Wei},
  journal= {arXiv preprint arXiv:2604.19300},
  year   = {2026}
}

备注

Accepted to ACL 2026