中文

XLS-R:大规模自监督跨语言语音表征学习

计算与语言 2021-12-17 v3 声音 音频与语音处理

摘要

本文提出 XLS-R,一种基于 wav2vec 2.0 的大规模跨语言语音表征学习模型。我们在 128 种语言近 50 万小时公开可用语音音频上训练了参数量高达 2B 的模型,其公开数据规模比已知最大先前工作高一个数量级。我们的评估涵盖广泛的任务、领域、数据体制与语言,包括高资源与低资源。在 CoVoST-2 语音翻译基准上,我们相较先前最优平均提升 7.4 BLEU(21 个翻译方向至英语)。在语音识别方面,XLS-R 在 BABEL、MLS、CommonVoice 以及 VoxPopuli 上均优于最佳已知先前工作,平均相对降低错误率 14–34%。XLS-R 还在 VoxLingua107 语言识别上创下新的最优。此外,我们表明在充足模型规模下,跨语言预训练在将英语语音翻译为其他语言时可优于仅英语预训练,而该设定本有利于单语预训练。我们希望 XLS-R 能帮助改善世界上更多语言的语音处理任务。

关键词

引用

@article{arxiv.2111.09296,
  title  = {XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale},
  author = {Arun Babu and Changhan Wang and Andros Tjandra and Kushal Lakhotia and Qiantong Xu and Naman Goyal and Kritika Singh and Patrick von Platen and Yatharth Saraf and Juan Pino and Alexei Baevski and Alexis Conneau and Michael Auli},
  journal= {arXiv preprint arXiv:2111.09296},
  year   = {2021}
}