视频序列中的人脸掩码提取
计算机视觉与模式识别
2021-03-02 v3
摘要
受近期基于深度网络的语义图像分割方法发展的启发,我们引入了一种端到端可训练的模型,用于视频序列中的人脸掩码提取。与基于 landmarks 的稀疏人脸形状表示相比,我们的方法能够生成各面部部件的分割掩码,从而更好地反映其详细的形状变化。通过将卷积 LSTM (ConvLSTM) 算法与全卷积网络 (FCN) 相集成,我们的新 ConvLSTM-FCN 模型以每序列为基础工作,并利用视频片段中的时间相关性。此外,我们还提出了一种称为分割损失 (Segmentation Loss) 的新损失函数,以直接优化交并比 (IoU) 性能。在实践中,为了进一步提高分割精度,我们训练了一个主模型和两个附加模型,分别专注于人脸、眼睛和嘴部区域。我们的实验表明,所提出的方法在 300 Videos in the Wild (300VW) 数据集上相对于基线 FCN 模型实现了 16.99% 的相对提升(平均 IoU 从 54.50% 提高到 63.76%)。
引用
@article{arxiv.1807.09207,
title = {Face Mask Extraction in Video Sequence},
author = {Yujiang Wang and Bingnan Luo and Jie Shen and Maja Pantic},
journal= {arXiv preprint arXiv:1807.09207},
year = {2021}
}
备注
300VW-Mask dataset is available at: https://github.com/mapleandfire/300VW-Mask