利用语音重建提升对比语音表示学习的噪声鲁棒性
声音
2021-11-01 v1 计算与语言
音频与语音处理
摘要
噪声鲁棒性对于在真实环境中部署自动语音识别(ASR)系统至关重要。减少噪声干扰影响的一种方法是采用执行语音增强的预处理模块,然后将增强后的语音送入 ASR 后端。在本工作中,我们不使用常规级联流水线抑制背景噪声,而是采用由精炼的自监督框架学习的噪声鲁棒表示用于含噪语音识别。我们提出将重建模块与对比学习结合,并在含噪数据上执行多任务持续预训练。重建模块用于辅助学习以提升所学表示的噪声鲁棒性,因此在推理时不需要。实验证明了我们提出方法的有效性。我们的模型显著降低了合成含噪 LibriSpeech 测试集的词错误率(WER),并与数据增强相比在含噪 clean/other 测试集上取得了约 4.1/7.5% 的 WER 降低。对于来自 CHiME-4 挑战赛(单通道 track)的真实世界含噪语音,我们在无任何去噪前端的情况下取得了 SOTA 的 ASR 性能。此外,仅使用 16% 的标注数据,我们就达到了与报道的最佳监督方法相当的性能。
引用
@article{arxiv.2110.15430,
title = {Improving Noise Robustness of Contrastive Speech Representation Learning with Speech Reconstruction},
author = {Heming Wang and Yao Qian and Xiaofei Wang and Yiming Wang and Chengyi Wang and Shujie Liu and Takuya Yoshioka and Jinyu Li and DeLiang Wang},
journal= {arXiv preprint arXiv:2110.15430},
year = {2021}
}
备注
5 pages, 1 figure, submitted to ICASSP 2022