中文

SHIELD:基于多模态大语言模型的人脸欺骗与伪造检测评估基准

计算机视觉与模式识别 2025-04-22 v2

摘要

多模态大语言模型凭借其视觉语义理解和推理能力,在视觉相关任务中展现出了强大的能力。然而,它们在人脸攻击检测任务中检测细微视觉欺骗和伪造线索的能力仍有待探索。在本文中,我们引入了一个基准 SHIELD,以评估 MLLM 在人脸欺骗与伪造检测方面的能力。具体而言,我们设计了真/假题和选择题,以评估 MLLM 在两项任务的多模态人脸数据上的性能。对于人脸反欺骗任务,我们在六种攻击类型下评估了三种模态(即 RGB、红外和深度)。对于人脸伪造检测任务,我们评估了基于 GAN 和基于扩散模型的数据,并结合了视觉和声学模态。我们在标准设置和思维链设置下进行了零样本和少样本评估。此外,我们提出了一种新颖的多属性思维链范式,用于描述和判断人脸图像的各种任务相关和任务无关属性。本研究的发现表明,MLLM 在应对人脸识别技术应用相关的安全挑战方面展现出巨大潜力。

关键词

引用

@article{arxiv.2402.04178,
  title  = {SHIELD : An Evaluation Benchmark for Face Spoofing and Forgery Detection with Multimodal Large Language Models},
  author = {Yichen Shi and Yuhao Gao and Yingxin Lai and Hongyang Wang and Jun Feng and Lei He and Jun Wan and Changsheng Chen and Zitong Yu and Xiaochun Cao},
  journal= {arXiv preprint arXiv:2402.04178},
  year   = {2025}
}

备注

Accepted by Visual Intelligence