中文

FLIP:基于语言引导的跨域人脸活体检测

计算机视觉与模式识别 2023-09-29 v1

摘要

人脸活体检测(FAS)或呈现攻击检测是人脸识别系统在安全关键应用中部署的重要组成部分。现有 FAS 方法对未见过的欺骗类型、摄像头传感器和环境条件的泛化能力较差。近年来,视觉Transformer(ViT)模型因能够捕捉图像块之间的长程依赖,已被证明对 FAS 任务有效。然而,通常需要自适应模块或辅助损失函数来适配在 ImageNet 等大规模数据集上预训练的 ViT 权重。在本工作中,我们首先表明,使用多模态(如 CLIP)预训练权重初始化 ViT 可提升 FAS 任务的泛化性,这与视觉-语言预训练(VLP)模型的零样本迁移能力一致。随后,我们提出一种新颖的鲁棒跨域 FAS 方法,借助自然语言对视觉表征进行 grounding。具体而言,我们表明将图像表征与一组类别描述(基于自然语言语义)集合对齐,可提升低数据量场景下的 FAS 泛化性。最后,我们提出一种多模态对比学习策略,以进一步增强特征泛化并缩小源域与目标域之间的差距。在三个标准协议上的大量实验表明,我们的方法显著优于最先进的方法,取得了比自适应 ViT 的五样本迁移更好的零样本迁移性能。代码:https://github.com/koushiksrivats/FLIP

关键词

引用

@article{arxiv.2309.16649,
  title  = {FLIP: Cross-domain Face Anti-spoofing with Language Guidance},
  author = {Koushik Srivatsan and Muzammal Naseer and Karthik Nandakumar},
  journal= {arXiv preprint arXiv:2309.16649},
  year   = {2023}
}

备注

Accepted to ICCV-2023. Project Page: https://koushiksrivats.github.io/FLIP/