中文

语音增强与自监督模型联合训练用于噪声鲁棒ASR

音频与语音处理 2022-05-27 v1 声音

摘要

语音增强(SE)通常作为前端用于改善噪声环境下的语音质量,然而由于语音失真,增强语音对于自动语音识别(ASR)系统可能并非最优。另一方面,研究表明自监督预训练能够利用大量无标注噪声数据,这对ASR的噪声鲁棒性颇有益处。然而,SE与自监督预训练(最优)结合的潜力仍不明确。为寻找合适的组合并减轻SE引起的语音失真影响,本文提出一种SE模块与自监督模型的联合预训练方法。首先,在预训练阶段,将原始噪声波形或经SE得到的波形输入自监督模型以学习上下文表示,其中量化后的干净语音作为目标。其次,我们提出双注意力融合方法以融合噪声语音与增强语音的特征,可补偿单独使用各模块所致的信息损失。由于对干净/噪声/增强分支的灵活利用,所提方法成为若干现有噪声鲁棒ASR模型(如增强wav2vec2.0)的推广。最后,在合成与真实噪声数据集上的实验结果表明,所提联合训练方法能在多种噪声设置下改善ASR性能,带来更强的噪声鲁棒性。

关键词

引用

@article{arxiv.2205.13293,
  title  = {Joint Training of Speech Enhancement and Self-supervised Model for Noise-robust ASR},
  author = {Qiu-Shi Zhu and Jie Zhang and Zi-Qiang Zhang and Li-Rong Dai},
  journal= {arXiv preprint arXiv:2205.13293},
  year   = {2022}
}

备注

submitted to IEEE/ACM TASLP. arXiv admin note: text overlap with arXiv:2201.08930