面向极端姿态与表情的高保真人脸操控
计算机视觉与模式识别
2021-01-19 v4
摘要
随着生成对抗网络(Generative Adversarial Networks, GAN)的繁荣,人脸操控取得了显著进展。然而,由于结构与纹理控制的困难性,同时对姿态和表情进行建模极具挑战,尤其是在高分辨率下的极端操控。在本文中,我们提出了一种新颖的框架,将人脸操控简化为两个相关阶段:边界预测阶段和解耦人脸合成阶段。第一阶段通过边界图像联合建模姿态与表情。具体而言,采用条件编码器-解码器网络以半监督方式预测目标人脸的边界图像。引入姿态与表情估计器以提高预测性能。在第二阶段,预测的边界图像与输入人脸图像分别通过两个编码器网络被编码至结构与纹理潜空间中。进一步施加代理网络与特征阈值损失以解耦潜空间。此外,由于缺乏高分辨率人脸操控数据库来验证我们方法的有效性,我们收集了一个新的高质量多视点人脸(Multi-View Face, MVF-HQ)数据库。该数据库包含来自 479 个身份的 120,283 张 6000x4000 分辨率的图像,具有多样的姿态、表情和光照。MVF-HQ 在规模和分辨率上均远超公开可用的高分辨率人脸操控数据库。我们将很快发布 MVF-HQ,以推动人脸操控的发展。在四个数据库上的定性与定量实验表明,我们的方法显著提升了合成质量。
引用
@article{arxiv.1903.12003,
title = {High Fidelity Face Manipulation with Extreme Poses and Expressions},
author = {Chaoyou Fu and Yibo Hu and Xiang Wu and Guoli Wang and Qian Zhang and Ran He},
journal= {arXiv preprint arXiv:1903.12003},
year = {2021}
}
备注
Accepted by IEEE Transactions on Information Forensics and Security (TIFS)