中文

基于噪声鲁棒自监督预训练模型的语音表征学习用于自动语音识别

音频与语音处理 2022-05-10 v1 声音

摘要

Wav2vec2.0 是一种流行的自监督预训练框架,用于在自动语音识别(ASR)背景下学习语音表征。已有研究表明 wav2vec2.0 对领域偏移具有良好的鲁棒性,但其噪声鲁棒性仍不明确。因此,本工作首先通过实验分析了 wav2vec2.0 的噪声鲁棒性。我们观察到,在含噪数据上预训练的 wav2vec2.0 可获得良好的表征,从而提升在含噪测试集上的 ASR 性能,但这会导致在干净测试集上的性能下降。为避免该问题,本工作提出一种增强型 wav2vec2.0 模型。具体而言,将含噪语音及其对应的干净版本输入同一特征编码器,其中干净语音为模型提供训练目标。实验结果表明,所提方法不仅能提升含噪测试集上的 ASR 性能并超越原始 wav2vec2.0,还能确保干净测试集上极小的性能下降。此外,在不同类型噪声条件下均证明了所提方法的有效性。

关键词

引用

@article{arxiv.2201.08930,
  title  = {A Noise-Robust Self-supervised Pre-training Model Based Speech Representation Learning for Automatic Speech Recognition},
  author = {Qiu-Shi Zhu and Jie Zhang and Zi-Qiang Zhang and Ming-Hui Wu and Xin Fang and Li-Rong Dai},
  journal= {arXiv preprint arXiv:2201.08930},
  year   = {2022}
}

备注

Accepted by ICASSP 2022