用于提高波士顿大学语音识别中 LLM 辅助鲁棒性的误差层噪声嵌入
计算与语言
2025-12-22 v1 人工智能
摘要
自动语音识别(ASR)系统在噪声环境中会出现显著性能下降,这一挑战尤其在资源有限的语言(如波斯语)中尤为严重。即使是最先进的模型如 Whisper 在不同的信噪比(SNR)下也难以保持准确性。本研究提出一种鲁棒噪声敏感的 ASR 错误纠正框架,结合多个假设和噪声感知建模。使用带噪声的波斯语语音,我们从修改后的 Whisper 大型解码器生成 5-best 假设。引入误差层噪声(Error Level Noise, ELN)作为一种表示,捕捉假设之间在语义和词元级别的不一致,从而量化噪声引起的语言扭曲。因此,ELN 提供了噪声引起不确定性的直接度量,使 LLM 能够在纠正每个假设的可靠性方面进行推理。评估了三个模型:(1)一个未微调的基础 LLaMA-2-7B 模型,(2)一个在仅文本假设上训练的微调版本,以及(3)集成 ELN 嵌入的噪声条件模型,分别在句子和词汇水平上。实验结果表明,ELN 条件化模型在字词错误率(WER)上实现了显著降低。具体而言,在具有挑战性的混合噪声测试集上,所提出的经过微调 + ELN(本方法)模型将 WER 从基准的 31.10%(Raw Whisper)降低至 24.84%,显著优于经过微调(无 ELN)仅文本基准的 30.79%,而原始 LLaMA-2-7B 模型将 WER 增加至 64.58%,表明该模型无法独立纠正波斯语错误。这一结果证明了将多个假设与噪声感知嵌入结合用于噪声环境下波斯语 ASR 的有效性。
引用
@article{arxiv.2512.17247,
title = {Incorporating Error Level Noise Embedding for Improving LLM-Assisted Robustness in Persian Speech Recognition},
author = {Zahra Rahmani and Hossein Sameti},
journal= {arXiv preprint arXiv:2512.17247},
year = {2025}
}