TransVIP:语音到语音翻译系统的声线与节律保持
计算与语言
2024-11-01 v3 人工智能
声音
音频与语音处理
摘要
语音到语音翻译直接将一种语言的语音翻译成另一种语言的研究呈日益增长的兴趣和趋势,称为端到端语音到语音翻译。然而,大多数端到端模型难以超过级联模型,即通过串联语音识别、机器翻译和文本到语音模型的管道框架。主要挑战源于直接翻译任务固有的复杂性以及数据的稀缺。本研究中,我们引入一种新型模型框架 TransVIP,通过联合概率实现级联数据驱动的端到端推断。此外,我们提出两种分离的编码器,在翻译过程中保留说话者的声线特征和节律,使其特别适用于视频配音场景。我们的实验在法语-英语语言对上表明,我们的模型优于当前最先进的语音到语音翻译模型。
引用
@article{arxiv.2405.17809,
title = {TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation},
author = {Chenyang Le and Yao Qian and Dongmei Wang and Long Zhou and Shujie Liu and Xiaofei Wang and Midia Yousefi and Yanmin Qian and Jinyu Li and Sheng Zhao and Michael Zeng},
journal= {arXiv preprint arXiv:2405.17809},
year = {2024}
}
备注
Neural Information Processing Systems, poster