中文

人人可配音:利用神经渲染先验实现数据高效的视觉配音

计算机视觉与模式识别 2024-01-12 v1 图形学

摘要

视觉配音是为视频中演员生成与给定音频同步的唇部动作的过程。近期进展已朝着这一目标取得进步,但尚未能产生适合大规模采用的方法。现有方法分为人物通用模型和人物特定模型两类。人物特定模型产生的结果几乎与现实无异,但依赖于使用大型单人数据集进行长时间训练。人物通用模型允许对任何视频进行任何音频的视觉配音而无需进一步训练,但这些模型无法捕捉人物特有的细微差别,且常常出现视觉伪影。我们的方法基于数据高效的神经渲染先验,克服了现有方法的局限性。我们的流程包括学习一个延迟神经渲染先验网络,以及使用神经纹理进行演员特定的适配。该方法允许仅用几秒钟的数据实现高质量视觉配音,从而为任何演员——从一线明星到背景演员——实现视频配音。我们通过两项用户研究,在视觉质量和可识别性方面定量和定性地展示了我们达到了最先进水平。我们的先验学习和适配方法在有限数据上的泛化能力更强,且比现有的人物特定模型更具可扩展性。我们在真实世界有限数据场景下的实验发现,我们的模型优于所有其他模型。项目页面可在 https://dubbingforeveryone.github.io/ 找到。

关键词

引用

@article{arxiv.2401.06126,
  title  = {Dubbing for Everyone: Data-Efficient Visual Dubbing using Neural Rendering Priors},
  author = {Jack Saunders and Vinay Namboodiri},
  journal= {arXiv preprint arXiv:2401.06126},
  year   = {2024}
}