Translatotron 3:利用单语数据的语音到语音翻译
计算与语言
2024-01-17 v3 机器学习
声音
音频与语音处理
摘要
本文提出 Translatotron 3,一种通过结合掩码自编码器、无监督嵌入映射与回译,从单语语音-文本数据集进行无监督直接语音到语音翻译的新方法。在西班牙语与英语之间的语音到语音翻译任务上的实验结果表明,Translatotron 3 优于级联基线系统,在合成的 Unpaired-Conversational 数据集上取得了 个 BLEU 点的提升。与需要真实配对数据或专门建模以复现停顿、语速和说话人身份等副语言/非语言信息的监督方法不同,Translatotron 3 展示了保留此类信息的能力。音频样本可在 http://google-research.github.io/lingvo-lab/translatotron3 获取。
引用
@article{arxiv.2305.17547,
title = {Translatotron 3: Speech to Speech Translation with Monolingual Data},
author = {Eliya Nachmani and Alon Levkovitch and Yifan Ding and Chulayuth Asawaroengchai and Heiga Zen and Michelle Tadmor Ramanovich},
journal= {arXiv preprint arXiv:2305.17547},
year = {2024}
}
备注
To appear in ICASSP 2024