中文

ViTransPAD:基于卷积与自注意力的视频Transformer人脸呈现攻击检测

计算机视觉与模式识别 2022-03-15 v2

摘要

人脸呈现攻击检测(PAD)是防止人脸生物识别系统遭受欺骗攻击的重要措施。许多基于卷积神经网络(CNNs)的人脸PAD工作将问题表述为图像级二分类任务,未考虑上下文。相反,使用自注意力关注图像上下文的视觉Transformer(ViT)成为人脸PAD的主流。受ViT启发,我们提出一种用于人脸PAD的基于视频的Transformer(ViTransPAD),其具有短/长程时空注意力,既可聚焦帧内短注意力下的局部细节,也能捕捉跨帧的长程依赖。不同于ViT中使用的单尺度粗粒度图像块,我们提出多尺度多头自注意力(MsMHSA)架构,以由粗到细的方式将Q、K、V特征图的多尺度块划分适配至Transformer的各头,从而学习细粒度表示以进行人脸PAD的像素级判别。由于纯Transformer缺乏卷积的归纳偏置,我们还将卷积引入所提ViTransPAD,通过卷积块嵌入与卷积投影整合CNNs的理想特性。大量实验显示了所提ViTransPAD的有效性及较佳的精度-计算平衡,其可作为人脸PAD的新骨干网络。

关键词

引用

@article{arxiv.2203.01562,
  title  = {ViTransPAD: Video Transformer using convolution and self-attention for Face Presentation Attack Detection},
  author = {Zuheng Ming and Zitong Yu and Musab Al-Ghadi and Muriel Visani and Muhammad MuzzamilLuqman and Jean-Christophe Burie},
  journal= {arXiv preprint arXiv:2203.01562},
  year   = {2022}
}