TeG-DG:面向人脸反欺骗的文本引导域泛化
计算机视觉与模式识别
2024-01-31 v2
摘要
提升人脸反欺骗(FAS)技术的域泛化性能已成为研究焦点。现有方法致力于从多种训练域中提取域不变特征。尽管性能可观,所提取特征不可避免地含有残差风格特征偏置(如光照、采集设备),导致泛化性能不佳。本文提出一种替代且有效的方案,即文本引导域泛化(TeG-DG)框架,其可有效利用文本信息实现跨域对齐。我们的核心见解是,文本作为更抽象且通用的表达形式,能捕捉各类攻击间的共性与本质特征,弥合不同图像域间的鸿沟。与现有视觉-语言模型不同,所提框架经精心设计以增强 FAS 任务的域泛化能力。具体而言,我们首先设计层级注意力融合(HAF)模块以实现不同层级视觉特征的自适应聚合;随后,提出文本增强视觉判别器(TEVD),不仅更好地对齐两种模态,还以无偏文本特征正则化分类器。TeG-DG 显著优于先前方法,尤其在源域数据极度有限时(HTER 与 AUC 上分别约 14% 和约 12% 的提升),展现出令人印象深刻的少样本性能。
引用
@article{arxiv.2311.18420,
title = {TeG-DG: Textually Guided Domain Generalization for Face Anti-Spoofing},
author = {Lianrui Mu and Jianhong Bai and Xiaoxuan He and Jiangnan Ye and Xiaoyu Liang and Yuchen Yang and Jiedong Zhuang and Haoji Hu},
journal= {arXiv preprint arXiv:2311.18420},
year = {2024}
}