面向域通用性人脸防欺诊的视觉基础模型基准测试
计算机视觉与模式识别
2026-04-22 v1
摘要
人脸防欺诊(FAS)因需在未见环境中实现鲁棒的域迁移而仍具挑战性。虽近期趋势利用视觉语言模型(VLM)进行语义监督,但这些多模态方法往往需要昂贵的计算资源且推理延迟高。此外,其有效性本质上受限于底层视觉特征的质量。本文重新审视视觉模型在建立高效且鲁棒FAS基准线方面的潜力。我们在包含MICO和有限源域(LSD)协议等严苛跨域场景下,对15个预训练模型(如监督CNN、监督ViT及自监督ViT)进行系统性基准测试。我们的全面分析揭示,自监督视觉模型,特别是带有Register的DINOv2,显著抑制注意力伪影,捕获关键细粒度欺诈线索。结合人脸防欺诊数据增强(FAS-Aug)、Patch级数据增强(PDA)及注意力加权Patch损失(APL),我们提出的视觉-only基准线在MICO协议下实现最先进性能。在数据受限的LSD协议下,该基准线超越现有方法,同时保持卓越的计算效率。这一工作为FAS提供了明确的视觉-only基准线,表明优化后的自监督视觉Transformer可作为视觉-only及未来多模态FAS系统的 backbone。项目页面地址:https://gsisaoki.github.io/FAS-VFMbenchmark-CVPRW2026/。
引用
@article{arxiv.2604.19196,
title = {Benchmarking Vision Foundation Models for Domain-Generalizable Face Anti-Spoofing},
author = {Mika Feng and Pierre Gallin-Martel and Koichi Ito and Takafumi Aoki},
journal= {arXiv preprint arXiv:2604.19196},
year = {2026}
}
备注
2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)