中文

重新思考多模态人脸防伪中的视觉 Transformer 与掩码自编码器

计算机视觉与模式识别 2023-02-14 v1

摘要

近来,基于视觉 Transformer(ViT)的多模态学习方法被提出以提升人脸防伪(FAS)系统的鲁棒性。然而,仍无工作探究 vanilla ViT 中多模态 FAS 的基本特性(如模态感知输入、合适的多模态预训练、高效微调)。本文中,我们针对 RGB、红外(IR)与深度(Depth)多模态 FAS,探究 ViT 中的三个关键因素(即输入、预训练与微调)。首先,关于 ViT 输入,我们发现利用局部特征描述子有益于 ViT 在 IR 模态上的表现,但对 RGB 或 Depth 模态无益。其次,鉴于直接微调全部或部分 ViT 的效率低下,我们设计了一种自适应多模态适配器(AMA),其能在冻结大部分 ViT 参数的同时高效聚合局部多模态特征。最后,考虑到任务(FAS 与通用物体分类)与模态(多模态与单模态)差异,ImageNet 预训练模型对多模态 FAS 任务可能非最优。为弥合这些差距,我们提出模态非对称掩码自编码器(M2^{2}A2^{2}E)用于多模态 FAS 自监督预训练,无需昂贵的标注标签。相较于以往的模态对称自编码器,所提 M2^{2}A2^{2}E 能学习更具内在任务感知的表示,并兼容模态无关(如单模态、双模态与三模态)的下游设置。在多个多模态 FAS 基准上以单模态(RGB、Depth、IR)与多模态(RGB+Depth、RGB+IR、Depth+IR、RGB+Depth+IR)设置开展的广泛实验证明了所提方法的优越性能。我们希望这些发现与方案能推动未来基于 ViT 的多模态 FAS 研究。

关键词

引用

@article{arxiv.2302.05744,
  title  = {Rethinking Vision Transformer and Masked Autoencoder in Multimodal Face Anti-Spoofing},
  author = {Zitong Yu and Rizhao Cai and Yawen Cui and Xin Liu and Yongjian Hu and Alex Kot},
  journal= {arXiv preprint arXiv:2302.05744},
  year   = {2023}
}