面向 hallucination 缓解的噪声感知类内学习方法
声音
2026-04-13 v1 人工智能
摘要
听觉大语言模型(ALLMs)在音频理解与推理任务中展现出强大的通用能力,但因 hallucination 问题而受限于可靠性。现有hallucination评估方法以二元分类形式构建,难以刻画生成任务中出现的复杂hallucination模式。此外,现有缓解策略依赖微调,计算成本高。为此,我们提出一种即插即用的Noise-Aware In-Context Learning(NAICL)方法。具体而言,我们构建噪声先验库,检索与输入音频相关的噪声样本,并将其作为上下文先验纳入模型,从而引导模型在声学证据不足时减少推测关联,采取更保守的生成策略。我们构建了面向音频描述任务的hallucination基准,包括Clotho-1K多事件基准数据集的构建、四类听觉hallucination的定义,以及用于细粒度分析的指标(如hallucination类型分布)。实验表明,所有评估的ALLMs均表现出相同hallucination行为。此外,NAICL方法将整体hallucination率从26.53%降至16.98%。
引用
@article{arxiv.2604.09021,
title = {Noise-Aware In-Context Learning for Hallucination Mitigation in ALLMs},
author = {Qixuan Huang and Khalid Zaman and Masashi Unoki},
journal= {arXiv preprint arXiv:2604.09021},
year = {2026}
}