中文

大规模多语言视听配音

计算机视觉与模式识别 2020-11-09 v1 声音 音频与语音处理

摘要

我们描述了一种大规模视听翻译与配音系统,可将视频从一种语言翻译为另一种语言。源语言的语音内容被转写为文本、翻译,并利用原说话人声音自动合成为目标语言语音。视觉内容通过为说话人合成与翻译后音频相匹配的唇部运动来翻译,从而在目标语言中创造无缝的视听体验。音频与视觉翻译子系统各自包含一个在对应领域数千小时数据上训练的大规模通用合成模型。这些通用模型在翻译前针对特定说话人进行微调,既可使用来自目标说话人的辅助数据语料,也可使用待翻译视频本身作为微调过程的输入。本报告给出了完整系统的架构概述,以及对视频配音组件的深入讨论。音频与文本组件相对于完整系统的角色被勾勒出来,但其设计未作详细讨论。使用我们系统生成翻译并配音的演示视频可在 https://www.youtube.com/playlist?list=PLSi232j2ZA6_1Exhof5vndzyfbxAhhEs5 观看。

关键词

引用

@article{arxiv.2011.03530,
  title  = {Large-scale multilingual audio visual dubbing},
  author = {Yi Yang and Brendan Shillingford and Yannis Assael and Miaosen Wang and Wendi Liu and Yutian Chen and Yu Zhang and Eren Sezener and Luis C. Cobo and Misha Denil and Yusuf Aytar and Nando de Freitas},
  journal= {arXiv preprint arXiv:2011.03530},
  year   = {2020}
}

备注

26 pages, 8 figures