基于RGB输入的实时面部分割与表演捕捉
计算机视觉与模式识别
2016-04-12 v1
摘要
我们提出了通过RGB输入中的显式语义分割实现无约束实时三维面部表演捕捉的概念。为确保鲁棒性,前沿的监督学习方法依赖于在真实场景中捕获的大规模人脸图像训练数据集。尽管对于大部分可见的人脸已展示出令人印象深刻的跟踪质量,但由于头发、饰品或手捂脸手势造成的任何遮挡都会导致显著的视觉伪影和跟踪精度损失。由于遮挡外观变化的巨大空间,其建模在很大程度上被避免。为应对这种高维灾难,我们在无约束图像中进行跟踪,假设非人脸区域可被完全掩码掉。随着深度学习的近期突破,我们证明通过改造最初为通用语义分割设计的卷积神经网络,像素级面部分割可实时实现。我们开发了一种基于具有互补特性的双流反卷积网络的高效架构,并引入了精心设计的训练样本和数据增强策略,以提高分割精度和鲁棒性。我们采用最先进的基于回归的面部跟踪框架,以分割后的人脸图像作为训练,展示了在极端遮挡甚至侧视情况下准确且不间断的面部表演捕捉。此外,所得的分割可直接用于在输入图像上合成部分三维人脸模型,并实现无缝的面部操控任务,如虚拟化妆或换脸。
引用
@article{arxiv.1604.02647,
title = {Real-Time Facial Segmentation and Performance Capture from RGB Input},
author = {Shunsuke Saito and Tianye Li and Hao Li},
journal= {arXiv preprint arXiv:1604.02647},
year = {2016}
}