学习表征与协同不变性:面向通用多模态人脸防欺诈的可证明框架
计算机视觉与模式识别
2025-11-19 v1
摘要
多模态人脸防欺诈(FAS)方法通过集成多种视觉模态,常在部署于未见域时 suffer 更严重的性能衰减。这主要源于两个被忽视的风险影响跨域多模态泛化。第一是模态表征不变风险,即在域迁移下表征是否保持可泛化性。我们理论证明,FAS中固有的类别非对称性(多样化作弊者 vs. 紧凑的真实样本)扩大了泛化误差上界,在多模态场景下该效应进一步被放大。第二是模态协同不变风险,模型对过拟合域特定的模态间相关性。这种伪相关性无法在目标域的未见攻击中泛化,导致性能下降。为解决此问题,我们提出了可证明的框架,即多模态表征与协同不变性学习(Multimodal Representation and Synergy Invariance, RiSe)。针对表征风险,RiSe引入非对称不变风险最小化(Asymmetric Invariant Risk Minimization, AsyIRM),在径向空间中学习不变的球面决策边界以拟合非对称分布,同时保留域相关线索在角度空间中。针对协同风险,RiSe采用多模态协同解缔(Multimodal Synergy Disentanglement, MMSD),通过跨样本混合与解缔,构建自监督任务以增强内在且可泛化的模态特征。理论分析和实验验证表明,RiSe实现了最新的跨域性能。
关键词
引用
@article{arxiv.2511.14157,
title = {Learning Representation and Synergy Invariances: A Povable Framework for Generalized Multimodal Face Anti-Spoofing},
author = {Xun Lin and Shuai Wang and Yi Yu and Zitong Yu and Jiale Zhou and Yizhong Liu and Xiaochun Cao and Alex Kot and Yefeng Zheng},
journal= {arXiv preprint arXiv:2511.14157},
year = {2025}
}