中文

FM-ViT:面向人脸活体检测的可灵活模态视觉Transformer

计算机视觉与模式识别 2023-05-08 v1

摘要

便捷的多模态(即RGB-D)传感器的普及引发了人脸活体检测研究的热潮。然而,当前的多模态人脸呈现攻击检测(PAD)存在两点不足:(1)基于多模态融合的框架需要提供与训练输入一致的模态,严重限制了部署场景。(2)基于ConvNet的模型在高保真数据集上的性能日益受限。本工作中,我们提出一种纯Transformer框架,称为可灵活模态视觉Transformer(FM-ViT),用于人脸活体检测,以借助可用的多模态数据灵活应对任意单模态(即RGB)攻击场景。具体而言,FM-ViT为每种模态保留特定分支以捕获不同模态信息,并引入跨模态Transformer块(CMTB),其由名为多头互注意力(MMA)与融合注意力(MFA)的两个级联注意力组成,分别引导各模态分支从信息丰富的patch token中挖掘潜在特征,以及通过丰富自身CLS token的模态信息来学习模态无关的活体特征。实验表明,基于FM-ViT训练的单模型不仅能灵活评估不同模态样本,还大幅优于现有单模态框架,并以更小的FLOPs和模型参数量逼近所引入的多模态框架。

关键词

引用

@article{arxiv.2305.03277,
  title  = {FM-ViT: Flexible Modal Vision Transformers for Face Anti-Spoofing},
  author = {Ajian Liu and Zichang Tan and Zitong Yu and Chenxu Zhao and Jun Wan and Yanyan Liang and Zhen Lei and Du Zhang and Stan Z. Li and Guodong Guo},
  journal= {arXiv preprint arXiv:2305.03277},
  year   = {2023}
}

备注

12 pages, 7 figures