中文

去噪与对齐:重新思考多模态人脸反欺骗的领域泛化

计算机视觉与模式识别 2025-05-15 v1

摘要

人脸反欺骗(FAS)是确保面部识别系统在支付处理和监视等多种场景下安全的关键。当前的多模态FAS方法往往难以实现有效的泛化,主要由于模态特定偏差和领域偏移。为解决这些挑战,我们引入了多模态去噪对齐(MMDA)框架。通过利用CLIP的零样本泛化能力,MMDA框架通过去噪和对齐机制有效抑制多模态数据中的噪声,从而显著提升跨模态对齐的泛化性能。MMDA框架中的模态-领域联合微分注意力(MD2A)模块通过基于提取的公共噪声特征来细化注意力机制,从而同时缓解领域和模态噪声的影响。此外,RS2对齐策略利用预训练的CLIP模型将多域多模态数据对齐到通用表示空间中,以灵活的方式保留复杂的表示,并增强模型对各种未见情况的适应性。我们还设计了一个U型双空间适应(U-DSA)模块,以在保持泛化性能的同时提升表示的适应性。这些改进不仅提升了框架的泛化能力,也增强了其表示复杂性的能力。我们在四个基准数据集上进行了不同评估协议下的实验,结果表明MMDA框架在跨域泛化和多模态检测准确性方面均优于现有的SOTA方法。代码将很快公开。

关键词

引用

@article{arxiv.2505.09484,
  title  = {Denoising and Alignment: Rethinking Domain Generalization for Multimodal Face Anti-Spoofing},
  author = {Yingjie Ma and Xun Lin and Zitong Yu and Xin Liu and Xiaochen Yuan and Weicheng Xie and Linlin Shen},
  journal= {arXiv preprint arXiv:2505.09484},
  year   = {2025}
}