面向语音翻译的大规模自监督与半监督学习
计算与语言
2021-04-15 v1
摘要
本文通过以不同且互补的方式有效利用大量无标注语音与文本数据来改进语音翻译(ST)。我们借助大型 Libri-Light 语音音频语料库探索预训练与自训练,并利用 CommonCrawl 进行语言建模。我们的实验通过将 wav2vec 2.0 预训练、单次自训练迭代与使用语言模型解码相结合这一简单方案,在所考虑的全部四个 CoVoST 2 语言对上平均比先前最优结果提升 2.6 BLEU。与已有工作不同,我们的方法除 ST 数据外不利用任何其他监督。代码与模型将公开发布。
引用
@article{arxiv.2104.06678,
title = {Large-Scale Self- and Semi-Supervised Learning for Speech Translation},
author = {Changhan Wang and Anne Wu and Juan Pino and Alexei Baevski and Michael Auli and Alexis Conneau},
journal= {arXiv preprint arXiv:2104.06678},
year = {2021}
}