中文

保持风格的神经视觉配音

计算机视觉与模式识别 2019-09-09 v2 图形学 机器学习

摘要

配音是一种将视频内容从一种语言翻译为另一种语言的技术。然而,最先进的视觉配音技术直接将源演员的面部表情复制到目标演员,而不考虑身份特定的习性,例如独特的微笑类型。我们提出一种基于单视频输入的风格保持视觉配音方法,在修改面部表情(包括嘴部运动)以匹配外语时,保持目标演员的标志性风格。我们方法的核心在于运动风格的概念,尤其针对面部表情,即除视觉准确性外人脸编辑应用中另一关键因素——人物特定的表情变化。我们的方法基于一个循环生成对抗网络,捕捉面部表情的时空共激活,并能在保持目标演员风格的同时生成和修改其面部表情。我们使用循环一致性与嘴部表情损失以无监督方式用未同步的源和目标视频训练模型,并利用分层神经人脸渲染器合成照片级真实感视频帧。我们的方法生成时间上连贯的结果,并能处理动态背景。结果表明,即便源与目标演员差异很大,我们的配音方法也比先前方法更好地保持了目标演员的特有风格。

关键词

引用

@article{arxiv.1909.02518,
  title  = {Neural Style-Preserving Visual Dubbing},
  author = {Hyeongwoo Kim and Mohamed Elgharib and Michael Zollhöfer and Hans-Peter Seidel and Thabo Beeler and Christian Richardt and Christian Theobalt},
  journal= {arXiv preprint arXiv:1909.02518},
  year   = {2019}
}

备注

SIGGRAPH Asia 2019