中文

视觉提示灵活模态人脸活体检测

计算机视觉与模式识别 2023-07-27 v1

摘要

近来,基于视觉Transformer的多模态学习方法被提出以提升人脸活体检测(FAS)系统的鲁棒性。然而,从真实世界收集的多模态人脸数据常因各类成像传感器缺失模态而不完美。近来,灵活模态FAS~\cite{yu2023flexible}引起更多关注,其旨在利用完整多模态人脸数据开发统一的多模态FAS模型,但对测试时缺失模态不敏感。本文中,我们应对灵活模态FAS中的一个主要挑战,即真实世界情形中训练或测试时发生的模态缺失。受近期提示学习在语言模型中成功的启发,我们提出\textbf{V}isual \textbf{P}rompt灵活模态\textbf{FAS}(VP-FAS),其学习模态相关提示以将冻结的预训练基础模型适配到下游灵活模态FAS任务。具体而言,将朴素视觉提示与残差上下文提示插入多模态Transformer以处理一般缺失模态情形,同时仅需少于4%的可学习参数相较于训练整个模型。此外,提出缺失模态正则化以迫使模型在缺失部分模态时学习一致的多模态特征嵌入。在两个多模态FAS基准数据集上的广泛实验证明了我们的VP-FAS框架在各种缺失模态情形下提升性能的同时缓解繁重模型重训练需求的有效性。

关键词

引用

@article{arxiv.2307.13958,
  title  = {Visual Prompt Flexible-Modal Face Anti-Spoofing},
  author = {Zitong Yu and Rizhao Cai and Yawen Cui and Ajian Liu and Changsheng Chen},
  journal= {arXiv preprint arXiv:2307.13958},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2303.03369 by other authors