中文

S-Adapter:基于统计令牌泛化视觉Transformer用于活体检测

计算机视觉与模式识别 2024-06-21 v2

摘要

活体检测(FAS)旨在检测通过呈现伪造人脸入侵人脸识别系统的恶意企图。最先进的 FAS 技术主要依赖深度学习模型,但其跨域泛化能力常受域偏移问题阻碍,该问题由训练与测试数据间不同分布引起。本研究在高效参数迁移学习(EPTL)范式下开发了一种泛化 FAS 方法,将预训练的 Vision Transformer 模型适配于 FAS 任务。训练时,适配器模块被插入预训练 ViT 模型中,仅更新适配器而其余预训练参数保持固定。我们发现以往朴素适配器的局限在于其基于线性层,缺乏欺骗感知的归纳偏置,从而限制了跨域泛化。为解决该局限并实现跨域泛化 FAS,我们提出一种新颖的统计适配器(S-Adapter),从局部化令牌直方图中聚合局部判别性与统计信息。为进一步提升统计令牌的泛化性,我们提出新颖的令牌风格正则化(TSR),旨在通过正则化跨域令牌提取的 Gram 矩阵来减小域风格方差。实验结果表明,所提 S-Adapter 与 TSR 在零样本与少样本跨域测试中均带来显著收益,在多个基准测试上优于最先进方法。录用后我们将发布源代码。

关键词

引用

@article{arxiv.2309.04038,
  title  = {S-Adapter: Generalizing Vision Transformer for Face Anti-Spoofing with Statistical Tokens},
  author = {Rizhao Cai and Zitong Yu and Chenqi Kong and Haoliang Li and Changsheng Chen and Yongjian Hu and Alex Kot},
  journal= {arXiv preprint arXiv:2309.04038},
  year   = {2024}
}

备注

Accepted by IEEE Transactions on Information Forensics Security (June 2024)