Neural Dubber:依据脚本为视频配音的神经网络模型
音频与语音处理
2022-03-16 v3 计算与语言
计算机视觉与模式识别
机器学习
声音
图像与视频处理
摘要
配音是重新录制演员台词的后期制作过程,广泛应用于电影制作和视频制作中。它通常由专业配音演员手动完成,这些演员以恰当的韵律朗读台词,并与预先录制的视频保持同步。在本工作中,我们提出 Neural Dubber,这是首个解决新颖的自动视频配音(AVD)任务的神经网络模型:从文本合成与给定视频同步的人声语音。Neural Dubber 是一个多模态文本到语音(TTS)模型,利用视频中的唇部运动来控制生成语音的韵律。此外,针对多说话人场景开发了基于图像的说话人嵌入(ISE)模块,使 Neural Dubber 能够根据说话人面部生成具有合理音色的语音。在化学讲座单说话人数据集和 LRS2 多说话人数据集上的实验表明,Neural Dubber 在语音质量方面可生成与最先进 TTS 模型相当的语音音频。最重要的是,定性和定量评估均表明,Neural Dubber 能够通过视频控制合成语音的韵律,并生成与视频在时间上同步的高保真语音。我们的项目页面位于 https://tsinghua-mars-lab.github.io/NeuralDubber/ 。
引用
@article{arxiv.2110.08243,
title = {Neural Dubber: Dubbing for Videos According to Scripts},
author = {Chenxu Hu and Qiao Tian and Tingle Li and Yuping Wang and Yuxuan Wang and Hang Zhao},
journal= {arXiv preprint arXiv:2110.08243},
year = {2022}
}
备注
Accepted by NeurIPS 2021; Project page at https://tsinghua-mars-lab.github.io/NeuralDubber/