中文

Everyone's Talkin':让我如你所愿地说话

计算机视觉与模式识别 2020-01-16 v1 图形学 多媒体

摘要

我们提出一种方法,通过输入一段音频序列来编辑目标肖像视频并合成照片级真实感视频。该方法的独特之处在于其高度动态性。它不假设特定于人的渲染网络,却能够将任意源音频转换为任意视频输出。我们不直接学习从音频到视频的高度异构且非线性的映射,而是首先通过单目 3D 人脸重建将每帧目标视频分解到正交的参数空间,即表情、几何与姿态。接下来,引入一个循环网络将源音频翻译为主要与音频内容相关的表情参数。音频翻译得到的表情参数随后被用于合成每帧照片级真实感人物,其中嘴部区域的运动精确映射到源音频。目标人物肖像的几何与姿态参数被保留,从而保持原始视频画面的上下文。最后,我们引入一种新颖的视频渲染网络与动态规划方法,以构建时间上连贯且照片级真实感的视频。大量实验证明了我们的方法相对于现有方法的优越性。我们的方法是端到端可学习的,并且对源音频中的声音变化具有鲁棒性。

关键词

引用

@article{arxiv.2001.05201,
  title  = {Everybody's Talkin': Let Me Talk as You Want},
  author = {Linsen Song and Wayne Wu and Chen Qian and Ran He and Chen Change Loy},
  journal= {arXiv preprint arXiv:2001.05201},
  year   = {2020}
}

备注

Technical report. Project page: https://wywu.github.io/projects/EBT/EBT.html