FLNet:用于忠实说话人脸动画合成的 landmarks 驱动提取与学习网络
计算机视觉与模式识别
2019-11-22 v1
摘要
说话人脸合成在基于外观或基于扭曲的方法中已被广泛研究。以往的工作大多利用单张人脸图像作为源,并通过融合其他人的面部特征来生成新的人脸动画。然而,某些面部区域(如眼睛或牙齿)可能在源图像中被遮挡,从而无法被忠实且稳定地合成。在本文中,我们提出了一种landmark驱动的双流网络来生成忠实的说话人脸动画,其中更多的面部细节从多张源图像而非单张图像中被创建、保留和迁移。具体而言,我们提出了一个由学习和提取流组成的网络。提取子网络直接学习从具有不同landmarks的五张源图像中注意力式地扭曲并融合面部区域,而学习流水线从训练人脸空间渲染面部器官以作补偿。与基线算法相比,大量实验表明所提方法在定量和定性上都取得了更高的性能。代码见https://github.com/kgu3/FLNet_AAAI2020。
引用
@article{arxiv.1911.09224,
title = {FLNet: Landmark Driven Fetching and Learning Network for Faithful Talking Facial Animation Synthesis},
author = {Kuangxiao Gu and Yuqian Zhou and Thomas Huang},
journal= {arXiv preprint arXiv:1911.09224},
year = {2019}
}
备注
Accepted by AAAI 2020