比实时更快的人脸对齐:无约束姿态下的三维空间变换网络方法
计算机视觉与模式识别
2017-09-11 v2
摘要
人脸对齐涉及在一幅图像上找到一组具有已知语义含义的地标点。然而,这些地标点的语义含义在2D方法中经常会丢失,因为随着人脸姿态的变化,地标要么被移动到可见边界,要么被忽略。为了在大姿态变化下提取一致的对齐点,必须在对齐步骤中考虑人脸的3D结构。然而,从单张2D图像提取3D结构通常首先需要对齐。我们提出一种新颖的方法,通过三维空间变换网络(3D Spatial Transformer Network, 3DSTN)同时提取人脸的3D形状和语义一致的2D对齐,以对3D模型的相机投影矩阵和变形参数进行建模。通过利用通用3D模型和薄板样条(Thin Plate Spline, TPS)变形函数,我们能够生成特定主体的3D形状,而无需大型3D形状基。此外,我们提出的网络可以在端到端框架中使用来自300W-LP数据集的完全合成数据进行训练。与其他3D方法不同,我们的方法仅需通过网络一次前向传播,从而实现比实时更快的对齐。我们的模型在野外标注人脸地标(Annotated Facial Landmarks in the Wild, AFLW)和AFLW2000-3D数据集上的评估表明,我们的方法在与其他3D对齐方法的比较中达到了最先进的性能。
引用
@article{arxiv.1707.05653,
title = {Faster Than Real-time Facial Alignment: A 3D Spatial Transformer Network Approach in Unconstrained Poses},
author = {Chandrasekhar Bhagavatula and Chenchen Zhu and Khoa Luu and Marios Savvides},
journal= {arXiv preprint arXiv:1707.05653},
year = {2017}
}
备注
International Conference on Computer Vision (ICCV) 2017