如教师般倾听:通过自适应层注意力和知识蒸馏减轻Whisper幻觉
人工智能
2025-11-19 v1 声音
摘要
Whisper模型是一种开源自动语音识别系统,因其在多语言和零样例设置下的强大性能而广泛采用。然而,它在噪声声学条件下经常出现幻觉错误。以往针对Whisper式ASR系统减少幻觉的工作主要关注音频预处理或对转录结果的后处理以过滤错误内容。然而,针对Whisper模型本身的修改以直接减轻幻觉的工作仍有限。为解决这一挑战,我们提出了两个阶段的体系结构,首先通过自适应层注意力(Adaptive Layer Attention, ALA)增强编码器的鲁棒性,进一步通过多目标知识蒸馏(KD)框架抑制幻觉。在第一个阶段,ALA通过跨层相关分析将编码器层分组为语义连贯的块。然后,一个可学习的多头注意力模块融合这些块表示,使模型能够联合利用低级和高级特征以实现更稳健的编码。在第二个阶段,我们的KD框架在噪声音频上训练学生模型,以其语义和注意力分布与处理干净输入的教师模型对齐。我们在噪声语音基准测试上进行实验,结果显示幻觉和词错误率显著降低,同时保持在干净语音上的性能。ALA和KD为改进Whisper在真实世界噪声条件下的可靠性提供了原则性策略。
引用
@article{arxiv.2511.14219,
title = {Listen Like a Teacher: Mitigating Whisper Hallucinations using Adaptive Layer Attention and Knowledge Distillation},
author = {Kumud Tripathi and Aditya Srinivas Menon and Aman Gaurav and Raj Prakash Gohil and Pankaj Wasnik},
journal= {arXiv preprint arXiv:2511.14219},
year = {2025}
}
备注
Accepted at AAAI 2026 - Main Technical Track