中文

面向语音识别的无监督跨语言表征学习

计算与语言 2020-12-17 v2 机器学习 声音 音频与语音处理

摘要

本文提出 XLSR,其通过从多种语言的语音原始波形中预训练单一模型来学习跨语言语音表征。我们基于 wav2vec 2.0 构建,该模型通过对掩码潜在语音表征求解对比任务进行训练,并联合学习跨语言共享的潜变量量化。所得模型在标注数据上微调,实验表明跨语言预训练显著优于单语预训练。在 CommonVoice 基准上,XLSR 相比已知最佳结果实现了 72% 的相对音素错误率降低。在 BABEL 上,我们的方法相比可比系统将词错误率相对改进了 16%。我们的方法使得单一多语言语音识别模型能够与强大的独立模型相竞争。分析表明,潜在离散语音表征跨语言共享,且相关语言间的共享程度更高。我们希望通过发布在 53 种语言上预训练的大模型 XLSR-53 来催化低资源语音理解的研究。

关键词

引用

@article{arxiv.2006.13979,
  title  = {Unsupervised Cross-lingual Representation Learning for Speech Recognition},
  author = {Alexis Conneau and Alexei Baevski and Ronan Collobert and Abdelrahman Mohamed and Michael Auli},
  journal= {arXiv preprint arXiv:2006.13979},
  year   = {2020}
}