用于人脸反欺诈的多视角 Slot 注意力与措辞文本
计算机视觉与模式识别
2025-09-16 v2 人工智能
密码学与安全
摘要
近期的人脸反欺诈(face anti-spoofing, FAS)方法已通过采用如 CLIP 等视觉语言模型展现出显著的跨域性能。然而,现有基于 CLIP 的 FAS 模型未充分利用 CLIP 的 patch 嵌入 token,无法检测关键的欺诈线索。此外,这些模型依赖每个类别(如 'live' 或 'fake')的单个文本提示,这限制了其泛化能力。为此,我们提出了 MVP-FAS,一种新型框架,包含两个关键模块:多视角 Slot 注意力(Multi-View Slot attention, MVS)和多文本 Patch 对齐(Multi-Text Patch Alignment, MTPA)。这两个模块均利用多个措辞文本生成以获得更通用的特征,减少对领域特定文本的依赖。MVS 通过利用多样化文本从 patch 嵌入中提取局部详细空间特征和全局上下文。MTPA 将 patch 与多个文本表示进行对齐,以提高语义鲁棒性。大量实验表明,MVP-FAS 在跨域数据集上实现了超越前沿方法的优异泛化性能。代码: https://github.com/Elune001/MVP-FAS。
引用
@article{arxiv.2509.06336,
title = {Multi-View Slot Attention Using Paraphrased Texts for Face Anti-Spoofing},
author = {Jeongmin Yu and Susang Kim and Kisu Lee and Taekyoung Kwon and Won-Yong Shin and Ha Young Kim},
journal= {arXiv preprint arXiv:2509.06336},
year = {2025}
}
备注
Accepted to ICCV 2025