基于三阶段训练的噪声解耦方法用于抗噪语音识别
音频与语音处理
2025-09-03 v1 声音
摘要
为提升端到端(E2E)语音识别系统在噪声或低信噪比(SNR)条件下的性能,本文提出了NoisyD-CT,一种基于Conformer-Transducer架构的新型三阶段训练框架。NoisyD-CT的核心是一个特别设计的紧凑型噪声解耦(Noisy Disentanglement, NoisyD)模块(仅增加1.71M参数),该模块集成在Conformer块和Transducer解码器之间,用于执行深度噪声抑制,并在具有挑战性的声学噪声环境中提高自动语音识别(ASR)的鲁棒性。为充分利用NoisyD-CT的噪声抑制能力,我们进一步提出了一种干净表示一致性损失,将从带噪语音中提取的高层表示与从相应干净语音中获得的表示对齐。结合噪声重建损失,这种一致性对齐使NoisyD模块能够有效抑制噪声,同时保留在干净和带噪条件下一致的声学和语言特征,从而产生更干净的内部表示以增强ASR性能。此外,我们的三阶段训练策略旨在整个模型训练过程中充分利用噪声解耦和语音识别模块的功能,最终最大化在噪声条件下的性能增益。我们在LibriSpeech和CHiME-4数据集上进行了实验,大量结果表明,我们提出的NoisyD-CT显著优于具有竞争力的Conformer-Transducer基线,在模拟和真实噪声测试集上分别实现了高达25.7%和10.6%的相对词错误率降低,同时在干净语音测试集上保持甚至提升了性能。源代码、模型检查点和数据模拟脚本将在https://github.com/litchimo/NoisyD-CT上发布。
引用
@article{arxiv.2509.01087,
title = {Noisy Disentanglement with Tri-stage Training for Noise-Robust Speech Recognition},
author = {Shuangyuan Chen and Shuang Wei and Dongxing Xu and Yanhua Long},
journal= {arXiv preprint arXiv:2509.01087},
year = {2025}
}
备注
11 pages,4 figures