通过掩码重建的无监督双向语音编码器预训练
音频与语音处理
2020-05-07 v2 声音
摘要
我们提出了一种通过掩码重建损失预训练语音表示的方法。我们的预训练编码器网络是双向的,因此可直接用于典型的双向语音识别模型。随后,预训练网络可在较少量的监督数据上微调以用于语音识别。在 LibriSpeech 和 Wall Street Journal 语料库上采用该方法的实验显示出有前景的结果。我们发现导致语音识别提升的主要因素是:在时间与频率上掩码足够宽度的片段、在远比标注数据大得多的未标注数据上预训练,以及当未标注与标注数据来自不同域时进行域适应。预训练带来的增益与监督数据增强的增益是可叠加的。
引用
@article{arxiv.2001.10603,
title = {Unsupervised Pre-training of Bidirectional Speech Encoders via Masked Reconstruction},
author = {Weiran Wang and Qingming Tang and Karen Livescu},
journal= {arXiv preprint arXiv:2001.10603},
year = {2020}
}
备注
Final version for ICASSP 2020