中文

Wav2vec-Switch:基于原始-噪声语音对的对比学习用于鲁棒语音识别

计算与语言 2022-01-27 v2 机器学习 声音 音频与语音处理

摘要

自监督学习(SSL)用于自动语音识别(ASR)的目标是从大量无标注语音中学习良好的语音表示以用于下游ASR任务。然而,大多数SSL框架未考虑噪声鲁棒性,而这对真实应用至关重要。本文提出wav2vec-Switch,一种通过对比学习将噪声鲁棒性编码到语音上下文表示中的方法。具体而言,我们将原始-噪声语音对同时输入wav2vec 2.0网络。除现有对比学习任务外,我们将原始与噪声语音的量化表示相互切换作为彼此的额外预测目标。这样做迫使网络对原始和噪声语音具有一致的预测,从而学习到具有噪声鲁棒性的上下文表示。我们在合成与真实噪声数据上的实验显示了方法的有效性:在合成噪声LibriSpeech数据上取得2.9--4.9%的相对词错误率(WER)降低且原始数据无退化,在CHiME-4真实单通道噪声数据上相比数据增强基线取得5.7%降低(即使使用强语言模型解码)。我们在CHiME-4上的结果可匹配甚至超越那些带有精心设计的语音增强组件的方法。

关键词

引用

@article{arxiv.2110.04934,
  title  = {Wav2vec-Switch: Contrastive Learning from Original-noisy Speech Pairs for Robust Speech Recognition},
  author = {Yiming Wang and Jinyu Li and Heming Wang and Yao Qian and Chengyi Wang and Yu Wu},
  journal= {arXiv preprint arXiv:2110.04934},
  year   = {2022}
}

备注

Accepted at IEEE ICASSP 2022. 5 pages, 1 figure