无 3D 监督下从单幅图像回归 3D 人脸形状与表情
计算机视觉与模式识别
2019-05-17 v1
摘要
从单幅图像估计 3D 人脸形状必须对光照、头部姿态、表情、面部毛发、化妆和遮挡的变化具有鲁棒性。鲁棒性需要大量的真实场景(in-the-wild)图像训练集,而这类图像按构造而言缺乏真实 3D 形状。为在无任何 2D 到 3D 监督的情况下训练网络,我们提出 RingNet,其学习从单幅图像计算 3D 人脸形状。我们的关键观察是,个体的脸形在不同图像中保持不变,无论表情、姿态、光照等如何。RingNet 利用一个人的多幅图像和自动检测的 2D 人脸特征。它使用一种新颖的损失函数,鼓励相同身份时脸形相似、不同人时脸形相异。我们通过使用 FLAME 模型表示人脸来实现对表情的不变性。一旦训练完成,我们的方法输入单幅图像并输出 FLAME 的参数,可易于驱动动画。此外,我们创建了一个新的面部数据库“并非完全真实场景”(NoW),包含受试者在多种条件下的 3D 头部扫描和高分辨率图像。我们评估了公开可用的方法,发现 RingNet 比使用 3D 监督的方法更准确。该数据集、模型和结果可用于研究目的,见 http://ringnet.is.tuebingen.mpg.de。
引用
@article{arxiv.1905.06817,
title = {Learning to Regress 3D Face Shape and Expression from an Image without 3D Supervision},
author = {Soubhik Sanyal and Timo Bolkart and Haiwen Feng and Michael J. Black},
journal= {arXiv preprint arXiv:1905.06817},
year = {2019}
}
备注
To appear in CVPR 2019