中文

通过掩码重建的无监督双向语音编码器预训练

音频与语音处理 2020-05-07 v2 声音

摘要

我们提出了一种通过掩码重建损失预训练语音表示的方法。我们的预训练编码器网络是双向的,因此可直接用于典型的双向语音识别模型。随后,预训练网络可在较少量的监督数据上微调以用于语音识别。在 LibriSpeech 和 Wall Street Journal 语料库上采用该方法的实验显示出有前景的结果。我们发现导致语音识别提升的主要因素是:在时间与频率上掩码足够宽度的片段、在远比标注数据大得多的未标注数据上预训练,以及当未标注与标注数据来自不同域时进行域适应。预训练带来的增益与监督数据增强的增益是可叠加的。

关键词

引用

@article{arxiv.2001.10603,
  title  = {Unsupervised Pre-training of Bidirectional Speech Encoders via Masked Reconstruction},
  author = {Weiran Wang and Qingming Tang and Karen Livescu},
  journal= {arXiv preprint arXiv:2001.10603},
  year   = {2020}
}

备注

Final version for ICASSP 2020