Translatotron 2:具备音色保持的高质量端到端语音到语音翻译
计算与语言
2022-05-19 v5 机器学习
声音
音频与语音处理
摘要
我们提出Translatotron 2,一种可端到端训练的神经网络直接语音到语音翻译模型。Translatotron 2由语音编码器、语言解码器、声学合成器以及连接它们的单一注意力模块组成。在三个数据集上的实验结果一致表明,Translatotron 2在翻译质量(最高+15.5 BLEU)和语音生成质量上均大幅优于原始Translatotron,并接近级联系统的水平。此外,我们提出一种简单的方法,用于将说话人音色从源语音保留到不同语言的翻译语音中。与现有方法不同,所提方法能够在说话人轮换时保持每位说话人的音色,且无需说话人分割。此外,与现有方法相比,它能更好地保护说话人隐私,并缓解利用音色克隆制造伪造音频制品的潜在滥用。
引用
@article{arxiv.2107.08661,
title = {Translatotron 2: High-quality direct speech-to-speech translation with voice preservation},
author = {Ye Jia and Michelle Tadmor Ramanovich and Tal Remez and Roi Pomerantz},
journal= {arXiv preprint arXiv:2107.08661},
year = {2022}
}
备注
ICML 2022