自训练与预训练在语音识别中具有互补性
机器学习
2020-10-23 v1 声音
音频与语音处理
摘要
自训练和无监督预训练已成为利用无标签数据改进语音识别系统的有效方法。然而,尚不清楚它们学习的是相似的模式还是能够有效结合。在本文中,我们表明在多种标签数据设置下,伪标注与基于 wav2vec 2.0 的预训练是互补的。仅使用 Libri-light 的 10 分钟标签数据和 LibriVox 的 53k 小时无标签数据,在 Librispeech 的 clean 和其他测试集上分别取得了 3.0%/5.2% 的 WER——可与一年前仅使用 960 小时标签数据训练的最佳已发表系统相媲美。在 Librispeech 的全部标签数据上训练取得了 1.5%/3.1% 的 WER。
引用
@article{arxiv.2010.11430,
title = {Self-training and Pre-training are Complementary for Speech Recognition},
author = {Qiantong Xu and Alexei Baevski and Tatiana Likhomanenko and Paden Tomasello and Alexis Conneau and Ronan Collobert and Gabriel Synnaeve and Michael Auli},
journal= {arXiv preprint arXiv:2010.11430},
year = {2020}
}