中文

Translatotron 2:具备音色保持的高质量端到端语音到语音翻译

计算与语言 2022-05-19 v5 机器学习 声音 音频与语音处理

摘要

我们提出Translatotron 2,一种可端到端训练的神经网络直接语音到语音翻译模型。Translatotron 2由语音编码器、语言解码器、声学合成器以及连接它们的单一注意力模块组成。在三个数据集上的实验结果一致表明,Translatotron 2在翻译质量(最高+15.5 BLEU)和语音生成质量上均大幅优于原始Translatotron,并接近级联系统的水平。此外,我们提出一种简单的方法,用于将说话人音色从源语音保留到不同语言的翻译语音中。与现有方法不同,所提方法能够在说话人轮换时保持每位说话人的音色,且无需说话人分割。此外,与现有方法相比,它能更好地保护说话人隐私,并缓解利用音色克隆制造伪造音频制品的潜在滥用。

关键词

引用

@article{arxiv.2107.08661,
  title  = {Translatotron 2: High-quality direct speech-to-speech translation with voice preservation},
  author = {Ye Jia and Michelle Tadmor Ramanovich and Tal Remez and Roi Pomerantz},
  journal= {arXiv preprint arXiv:2107.08661},
  year   = {2022}
}

备注

ICML 2022