中文

CoVoST: 一个多样化的多语言语音到文本翻译语料库

计算与语言 2020-06-11 v2

摘要

得益于端到端模型的发展以及如 Augmented LibriSpeech 和 MuST-C 等新语料库的创建,口语翻译近年来重新受到关注。现有数据集涉及的语种对均以英语为源语言,涉及非常特定的领域或是低资源语种。我们介绍了 CoVoST,一个从 11 种语言到英语的多语言语音到文本翻译语料库,具有超过 11,000 名说话人和超过 60 种口音的多样性。我们描述了数据集创建方法,并提供了数据质量的经验证据。我们还提供了初始基准,据我们所知,其中包括首个用于口语翻译的端到端多对一多语言模型。CoVoST 以 CC0 许可发布并可免费使用。我们还提供了基于 Tatoeba 在 CC 许可下派生的额外评估数据。

关键词

引用

@article{arxiv.2002.01320,
  title  = {CoVoST: A Diverse Multilingual Speech-To-Text Translation Corpus},
  author = {Changhan Wang and Juan Pino and Anne Wu and Jiatao Gu},
  journal= {arXiv preprint arXiv:2002.01320},
  year   = {2020}
}

备注

LREC 2020 camera-ready