通过跨模态特征转换实现多模态人脸反欺骗
计算机视觉与模式识别
2025-07-09 v1
摘要
多模态人脸反欺骗(FAS)旨在通过从多种模态(如RGB、红外(IR)和深度图像)中提取判别性活体线索来检测真实人类存在,从而增强生物特征认证系统的鲁棒性。然而,由于来自不同模态的数据通常由各种相机传感器并在不同环境条件下捕获,与单模态FAS相比,多模态FAS在训练和测试域之间通常表现出显著更大的分布差异。此外,在推理阶段,当一个或多个模态不可用或无法访问时,多模态FAS面临更大的挑战。在本文中,我们提出了一种新颖的跨模态转换引导网络(CTNet)来应对多模态FAS任务中的挑战。我们的动机源于:在单一模态内,活体人脸之间的视觉差异通常远小于欺骗人脸之间的差异。此外,与活体类和欺骗类之间的特征转换相比,活体类的跨模态特征转换更为一致。基于这一见解,我们首先提出学习活体样本之间一致的跨模态特征转换,以构建一个广义特征空间。接下来,我们引入学习活体样本和欺骗样本之间不一致的跨模态特征转换,以在推理过程中有效检测分布外(OOD)攻击。为了进一步解决模态缺失问题,我们提出从RGB模态学习互补的红外(IR)和深度特征作为辅助模态。大量实验表明,所提出的CTNet在大多数协议上优于先前的两类多模态FAS方法。
引用
@article{arxiv.2507.05575,
title = {Multi-Modal Face Anti-Spoofing via Cross-Modal Feature Transitions},
author = {Jun-Xiong Chong and Fang-Yu Hsu and Ming-Tsung Hsu and Yi-Ting Lin and Kai-Heng Chien and Chiou-Ting Hsu and Pei-Kai Huang},
journal= {arXiv preprint arXiv:2507.05575},
year = {2025}
}