中文

面向视频会议的一-shot自由视角神经说话头合成

计算机视觉与模式识别 2021-04-06 v3

摘要

我们提出了一种神经说话头视频合成模型,并展示了其在视频会议中的应用。我们的模型使用包含目标人物外观的源图像与决定输出中运动的驱动视频,学习合成说话头视频。我们的运动基于一种新颖的关键点表示进行编码,其中身份相关与运动相关信息被无监督地分解。大量实验验证表明,我们的模型在基准数据集上优于竞争方法。此外,我们紧凑的关键点表示实现了一种视频会议系统,其在仅使用十分之一带宽的同时,达到与商用H.264标准相同的视觉质量。另外,我们展示关键点表示允许用户在合成过程中旋转头部,这有助于模拟面对面视频会议体验。

关键词

引用

@article{arxiv.2011.15126,
  title  = {One-Shot Free-View Neural Talking-Head Synthesis for Video Conferencing},
  author = {Ting-Chun Wang and Arun Mallya and Ming-Yu Liu},
  journal= {arXiv preprint arXiv:2011.15126},
  year   = {2021}
}

备注

CVPR 2021 camera ready (oral). Our project page can be found at https://nvlabs.github.io/face-vid2vid