中文

Neural Dubber:依据脚本为视频配音的神经网络模型

音频与语音处理 2022-03-16 v3 计算与语言 计算机视觉与模式识别 机器学习 声音 图像与视频处理

摘要

配音是重新录制演员台词的后期制作过程,广泛应用于电影制作和视频制作中。它通常由专业配音演员手动完成,这些演员以恰当的韵律朗读台词,并与预先录制的视频保持同步。在本工作中,我们提出 Neural Dubber,这是首个解决新颖的自动视频配音(AVD)任务的神经网络模型:从文本合成与给定视频同步的人声语音。Neural Dubber 是一个多模态文本到语音(TTS)模型,利用视频中的唇部运动来控制生成语音的韵律。此外,针对多说话人场景开发了基于图像的说话人嵌入(ISE)模块,使 Neural Dubber 能够根据说话人面部生成具有合理音色的语音。在化学讲座单说话人数据集和 LRS2 多说话人数据集上的实验表明,Neural Dubber 在语音质量方面可生成与最先进 TTS 模型相当的语音音频。最重要的是,定性和定量评估均表明,Neural Dubber 能够通过视频控制合成语音的韵律,并生成与视频在时间上同步的高保真语音。我们的项目页面位于 https://tsinghua-mars-lab.github.io/NeuralDubber/ 。

关键词

引用

@article{arxiv.2110.08243,
  title  = {Neural Dubber: Dubbing for Videos According to Scripts},
  author = {Chenxu Hu and Qiao Tian and Tingle Li and Yuping Wang and Yuxuan Wang and Hang Zhao},
  journal= {arXiv preprint arXiv:2110.08243},
  year   = {2022}
}

备注

Accepted by NeurIPS 2021; Project page at https://tsinghua-mars-lab.github.io/NeuralDubber/