ViTransPAD:基于卷积与自注意力的视频Transformer人脸呈现攻击检测
计算机视觉与模式识别
2022-03-15 v2
摘要
人脸呈现攻击检测(PAD)是防止人脸生物识别系统遭受欺骗攻击的重要措施。许多基于卷积神经网络(CNNs)的人脸PAD工作将问题表述为图像级二分类任务,未考虑上下文。相反,使用自注意力关注图像上下文的视觉Transformer(ViT)成为人脸PAD的主流。受ViT启发,我们提出一种用于人脸PAD的基于视频的Transformer(ViTransPAD),其具有短/长程时空注意力,既可聚焦帧内短注意力下的局部细节,也能捕捉跨帧的长程依赖。不同于ViT中使用的单尺度粗粒度图像块,我们提出多尺度多头自注意力(MsMHSA)架构,以由粗到细的方式将Q、K、V特征图的多尺度块划分适配至Transformer的各头,从而学习细粒度表示以进行人脸PAD的像素级判别。由于纯Transformer缺乏卷积的归纳偏置,我们还将卷积引入所提ViTransPAD,通过卷积块嵌入与卷积投影整合CNNs的理想特性。大量实验显示了所提ViTransPAD的有效性及较佳的精度-计算平衡,其可作为人脸PAD的新骨干网络。
引用
@article{arxiv.2203.01562,
title = {ViTransPAD: Video Transformer using convolution and self-attention for Face Presentation Attack Detection},
author = {Zuheng Ming and Zitong Yu and Musab Al-Ghadi and Muriel Visani and Muhammad MuzzamilLuqman and Jean-Christophe Burie},
journal= {arXiv preprint arXiv:2203.01562},
year = {2022}
}