中文

FACIAL:基于隐式属性学习的动态说话人脸合成

计算机视觉与模式识别 2021-08-19 v1

摘要

本文提出一种说话人脸生成方法,以音频信号为输入、以短目标视频片段为参考,合成目标人脸的写实视频,其自然的唇部运动、头部姿态与眨眼与输入音频信号同步。我们注意到合成人脸属性不仅包括与语音高度相关的显式属性(如唇部运动),还包括与输入音频仅弱相关的隐式属性(如头部姿态与眨眼)。为建模不同人脸属性与输入音频间此类复杂关系,我们提出 FACe 隐式属性学习生成对抗网络(FACIAL-GAN),其整合音素感知、上下文感知与身份感知信息,以合成具有逼真唇部、头部姿态与眨眼运动的 3D 人脸动画。随后,我们的渲染到视频网络以渲染人脸图像与眨眼注意力图作为输入,生成写实输出视频帧。实验结果和用户研究表明,我们的方法能生成逼真说话人脸视频,不仅唇部运动同步,且头部运动与眨眼自然,质量优于当前最优方法的结果。

关键词

引用

@article{arxiv.2108.07938,
  title  = {FACIAL: Synthesizing Dynamic Talking Face with Implicit Attribute Learning},
  author = {Chenxu Zhang and Yifan Zhao and Yifei Huang and Ming Zeng and Saifeng Ni and Madhukar Budagavi and Xiaohu Guo},
  journal= {arXiv preprint arXiv:2108.07938},
  year   = {2021}
}

备注

10 pages, 9 figures. Accepted by ICCV 2021