FACIAL:基于隐式属性学习的动态说话人脸合成
计算机视觉与模式识别
2021-08-19 v1
摘要
本文提出一种说话人脸生成方法,以音频信号为输入、以短目标视频片段为参考,合成目标人脸的写实视频,其自然的唇部运动、头部姿态与眨眼与输入音频信号同步。我们注意到合成人脸属性不仅包括与语音高度相关的显式属性(如唇部运动),还包括与输入音频仅弱相关的隐式属性(如头部姿态与眨眼)。为建模不同人脸属性与输入音频间此类复杂关系,我们提出 FACe 隐式属性学习生成对抗网络(FACIAL-GAN),其整合音素感知、上下文感知与身份感知信息,以合成具有逼真唇部、头部姿态与眨眼运动的 3D 人脸动画。随后,我们的渲染到视频网络以渲染人脸图像与眨眼注意力图作为输入,生成写实输出视频帧。实验结果和用户研究表明,我们的方法能生成逼真说话人脸视频,不仅唇部运动同步,且头部运动与眨眼自然,质量优于当前最优方法的结果。
引用
@article{arxiv.2108.07938,
title = {FACIAL: Synthesizing Dynamic Talking Face with Implicit Attribute Learning},
author = {Chenxu Zhang and Yifan Zhao and Yifei Huang and Ming Zeng and Saifeng Ni and Madhukar Budagavi and Xiaohu Guo},
journal= {arXiv preprint arXiv:2108.07938},
year = {2021}
}
备注
10 pages, 9 figures. Accepted by ICCV 2021