中文

CVSS 语料库与大规模多语种语音到语音翻译

计算与语言 2022-06-28 v3 声音 音频与语音处理

摘要

我们介绍了 CVSS,一个大规模多语种到英语的语音到语音翻译(S2ST)语料库,涵盖来自 21 种语言到英语的句子级平行 S2ST 对。CVSS 源自 Common Voice 语音语料库和 CoVoST 2 语音到文本翻译(ST)语料库,通过使用最先进的 TTS 系统将 CoVoST 2 的翻译文本合成为语音得到。提供两个版本的翻译语音:1)CVSS-C:所有翻译语音均为单一高质量规范嗓音;2)CVSS-T:翻译语音为从相应源语音迁移而来的嗓音。此外,CVSS 提供与翻译语音中发音相匹配的规范化翻译文本。在 CVSS 的每个版本上,我们构建了多语种直接 S2ST 模型和级联 S2ST 模型,验证了该语料库的有效性。为构建强级联 S2ST 基线,我们在 CoVoST 2 上训练了一个 ST 模型,其比在无非额外数据的语料库上训练的先前最优模型高出 5.8 BLEU。尽管如此,直接 S2ST 模型在从头训练时性能接近强级联基线,且在从匹配的 ST 模型初始化时,于 ASR 转写的翻译上仅有 0.1 或 0.7 BLEU 的差异。

关键词

引用

@article{arxiv.2201.03713,
  title  = {CVSS Corpus and Massively Multilingual Speech-to-Speech Translation},
  author = {Ye Jia and Michelle Tadmor Ramanovich and Quan Wang and Heiga Zen},
  journal= {arXiv preprint arXiv:2201.03713},
  year   = {2022}
}

备注

LREC 2022