CoVoST: 一个多样化的多语言语音到文本翻译语料库
计算与语言
2020-06-11 v2
摘要
得益于端到端模型的发展以及如 Augmented LibriSpeech 和 MuST-C 等新语料库的创建,口语翻译近年来重新受到关注。现有数据集涉及的语种对均以英语为源语言,涉及非常特定的领域或是低资源语种。我们介绍了 CoVoST,一个从 11 种语言到英语的多语言语音到文本翻译语料库,具有超过 11,000 名说话人和超过 60 种口音的多样性。我们描述了数据集创建方法,并提供了数据质量的经验证据。我们还提供了初始基准,据我们所知,其中包括首个用于口语翻译的端到端多对一多语言模型。CoVoST 以 CC0 许可发布并可免费使用。我们还提供了基于 Tatoeba 在 CC 许可下派生的额外评估数据。
引用
@article{arxiv.2002.01320,
title = {CoVoST: A Diverse Multilingual Speech-To-Text Translation Corpus},
author = {Changhan Wang and Juan Pino and Anne Wu and Jiatao Gu},
journal= {arXiv preprint arXiv:2002.01320},
year = {2020}
}
备注
LREC 2020 camera-ready