中文

AHA:通过反事实困难负样本对齐大型音频语言模型以消除推理幻觉

声音 2026-01-06 v2 人工智能 计算与语言 多媒体

摘要

尽管大型音频语言模型(LALMs)提供了最先进的(SOTA)性能,但它们经常遭受幻觉问题,例如生成缺乏音频输入依据的文本。我们分析了这些依据失败案例,并识别出一个独特的分类体系:事件遗漏、错误事件身份、时间关系错误和定量时间错误。为了解决这一问题,我们引入了 AHA(Audio Hallucination Alignment,音频幻觉对齐)框架。通过利用反事实困难负样本挖掘,我们的流程构建了一个高质量的偏好数据集,迫使模型区分严格的声学证据与语言上看似合理的捏造。此外,我们建立了 AHA-Eval,这是一个旨在严格测试这些细粒度时间推理能力的诊断基准。我们将此数据应用于对齐 Qwen2.5-Omni。由此产生的模型 Qwen-Audio-AHA 在 AHA-Eval 上取得了 13.7% 的提升。至关重要的是,这种收益可推广至我们的诊断集之外。我们的模型在公开基准上表现出显著提升,包括在 MMAU-Test 上提升 1.3%,在 MMAR 上提升 1.6%,优于最新的 SOTA 方法。模型和数据集已在 https://github.com/LLM-VLM-GSL/AHA 开源。

关键词

引用

@article{arxiv.2512.24052,
  title  = {AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives},
  author = {Yanxi Chen and Wenhui Zhu and Xiwen Chen and Zhipeng Wang and Xin Li and Peijie Qiu and Hao Wang and Xuanzhao Dong and Yujian Xiong and Anderson Schneider and Yuriy Nevmyvaka and Yalin Wang},
  journal= {arXiv preprint arXiv:2512.24052},
  year   = {2026}
}