MA-ViT:面向人脸反欺骗的模态无关视觉Transformer
计算机视觉与模式识别
2023-04-18 v1
摘要
现有的多模态人脸反欺骗(FAS)框架基于两种策略设计:半融合与晚期融合。然而,前者要求测试模态与训练输入保持一致,严重限制了其部署场景;后者建立在多个分支上以独立处理不同模态,限制了其在低内存或快速执行需求应用中的使用。本工作中,我们提出一种基于单分支的Transformer框架,即模态无关视觉Transformer(MA-ViT),旨在借助多模态数据提升任意模态攻击的检测性能。具体而言,MA-ViT采用早期融合来聚合所有可用的训练模态数据,并支持对任意给定模态样本的灵活测试。进一步,我们在MA-ViT中设计了模态无关Transformer块(MATB),其由名为模态解耦注意力(MDA)与跨模态注意力(CMA)的两个堆叠注意力组成,分别用于消除各模态序列中与模态相关的信息,以及从另一模态序列中补充模态无关的活体特征。实验表明,基于MA-ViT训练的单模型不仅能灵活评估不同模态样本,还大幅优于现有单模态框架,并以更小的FLOPs与模型参数量逼近所引入的多模态框架。
引用
@article{arxiv.2304.07549,
title = {MA-ViT: Modality-Agnostic Vision Transformers for Face Anti-Spoofing},
author = {Ajian Liu and Yanyan Liang},
journal= {arXiv preprint arXiv:2304.07549},
year = {2023}
}
备注
7 pages, 4 figures, conference