中文

SpeechMatrix:一个大规模多语言语音到语音翻译挖掘语料库

计算与语言 2022-11-10 v1 声音 音频与语音处理

摘要

我们提出了 SpeechMatrix,一个从欧洲议会真实录音中挖掘的大规模多语言语音到语音翻译语料库。它包含 136 个语言对的语音对齐,总计 41.8 万小时的语音。为评估该平行语音的质量,我们仅使用挖掘数据训练双语语音到语音翻译模型,并在 EuroParl-ST、VoxPopuli 和 FLEURS 测试集上建立了广泛的基线结果。借助 SpeechMatrix 的多语言性,我们还探索了多语言语音到语音翻译,这是一个此前仅有少数工作涉及的主题。我们还证明,模型预训练和使用混合专家(Mixture-of-Experts)的稀疏扩展为翻译性能带来了巨大提升。挖掘的数据和模型均可免费获取。

关键词

引用

@article{arxiv.2211.04508,
  title  = {SpeechMatrix: A Large-Scale Mined Corpus of Multilingual Speech-to-Speech Translations},
  author = {Paul-Ambroise Duquenne and Hongyu Gong and Ning Dong and Jingfei Du and Ann Lee and Vedanuj Goswani and Changhan Wang and Juan Pino and Benoît Sagot and Holger Schwenk},
  journal= {arXiv preprint arXiv:2211.04508},
  year   = {2022}
}

备注

18 pages