FA³-CLIP:基于频率感知的 cues 融合与面向统一人脸攻击检测的攻击无关提示学习
计算机视觉与模式识别
2025-04-02 v1
摘要
人脸识别系统对物理(如打印照片)和数字(如 DeepFake) 人脸攻击极其脆弱。现有方法在检测物理与数字攻击时难以同时实现,主要原因是:1) 这些攻击类型之间的类内变异显著,2) 仅凭空间信息不足以全面捕捉活体与假体 cues。为此,我们提出一种统一的攻击检测模型,称为 Frequency-Aware and Attack-Agnostic CLIP (FA³-CLIP),通过引入攻击无关提示学习来表达从空间特征和频率特征融合中派生的通用活体与假体 cues,从而实现对活体面孔和所有类别攻击的统一检测。具体而言,攻击无关提示模块在语言分支生成通用活体与假体提示,从而从活体面孔和假体面孔中提取相应的通用表示,引导模型学习统一特征空间以实现统一攻击检测。同时,该模块会自适应地从原始空间和频率信息中生成活体/假体条件偏置,以优化通用提示,从而降低类内变异的影响。我们进一步提出了视觉分支中的双流 cues 融合框架,该框架利用频率信息补充空间域难以捕捉的细微 cues。此外,频率流中还引入了频率压缩模块,以减少频率特征的冗余性,同时保持关键 cues 的多样性。我们还建立了新的具有挑战性的协议,以促进统一人脸攻击检测的有效性。实验结果表明,所提方法在检测物理和数字人脸攻击方面显著提升了性能,实现了最先进的效果。
引用
@article{arxiv.2504.00454,
title = {FA^{3}-CLIP: Frequency-Aware Cues Fusion and Attack-Agnostic Prompt Learning for Unified Face Attack Detection},
author = {Yongze Li and Ning Li and Ajian Liu and Hui Ma and Liying Yang and Xihong Chen and Zhiyao Liang and Yanyan Liang and Jun Wan and Zhen Lei},
journal= {arXiv preprint arXiv:2504.00454},
year = {2025}
}
备注
12 pages, 5 figures