中文

FaceShield:基于多模态大语言模型的可解释人脸反欺骗

计算机视觉与模式识别 2025-11-18 v2

摘要

人脸反欺骗(FAS)对于保护人脸识别系统免受呈现攻击至关重要。以往方法将该任务视为分类问题,缺乏预测结果背后的可解释性与推理能力。近期,多模态大语言模型(MLLMs)在视觉任务的感知、推理与决策方面展现出强大能力。然而,目前尚无专门为 FAS 任务设计的通用且全面的 MLLM 与数据集。为弥补这一空白,我们提出了 FaceShield,一种用于 FAS 的 MLLM,并构建了相应的预训练与监督微调(SFT)数据集 FaceShield-pre10K 和 FaceShield-sft45K。FaceShield 能够判定人脸真伪、识别欺骗攻击类型、提供其判断的推理依据,并检测攻击区域。具体而言,我们采用欺骗感知视觉感知(SAVP),融合原始图像与基于先验知识的辅助信息。随后,我们使用提示引导的视觉 token 遮蔽(PVTM)策略对视觉 token 进行随机遮蔽,从而提升模型的泛化能力。我们在三个基准数据集上进行了大量实验,结果表明 FaceShield 在粗粒度分类、细粒度分类、推理和攻击定位这四个 FAS 任务上均显著优于以往的深度学习模型与通用 MLLMs。我们的指令数据集、协议和代码将发布于 https://github.com/Why0912/FaceShield。

关键词

引用

@article{arxiv.2505.09415,
  title  = {FaceShield: Explainable Face Anti-Spoofing with Multimodal Large Language Models},
  author = {Hongyang Wang and Yichen Shi and Zhuofu Tao and Yuhao Gao and Liepiao Zhang and Xun Lin and Jun Feng and Xiaochen Yuan and Zitong Yu and Xiaochun Cao},
  journal= {arXiv preprint arXiv:2505.09415},
  year   = {2025}
}

备注

Accepted by AAAI 2025. Hongyang Wang and Yichen Shi contribute equally. Corresponding author: Zitong Yu