M3FAS:一种准确且鲁棒的多模态移动端人脸反欺骗系统
多媒体
2024-03-22 v3 计算机视觉与模式识别
摘要
人脸呈现攻击(FPA),亦称人脸欺骗,已通过金融欺诈与隐私泄露等多种恶意应用引发公众日益增加的担忧。因此,保护人脸识别系统免受 FPA 至关重要。尽管现有基于学习的人脸反欺骗(FAS)模型可取得优异检测性能,但其缺乏泛化能力,在未知环境中性能显著下降。许多方法寻求在呈现攻击检测(PAD)期间使用辅助模态数据(如深度与红外图)以解决此局限。然而,这些方法受限在于:(1) 需要深度与红外相机等特定传感器采集数据,而商用移动设备鲜有配备;(2) 在任一模态缺失或质量不佳的实际场景中无法正常工作。本文设计了准确且鲁棒的多模态移动端人脸反欺骗系统 M3FAS 以克服上述问题。本工作的主要创新在于:(1) 为实现鲁棒 PAD,我们的系统结合视觉与听觉模态,使用相机、扬声器与麦克风三种常见传感器;(2) 我们设计了一种带三个层级特征聚合模块的双分支神经网络以进行跨模态特征融合;(3) 我们提出多头训练策略,使模型能从视觉、听觉与融合头输出预测,从而实现更灵活的 PAD。大量实验证明了 M3FAS 在各种挑战性实验设置下的准确性、鲁棒性与灵活性。源代码与数据集见:https://github.com/ChenqiKONG/M3FAS/
引用
@article{arxiv.2301.12831,
title = {M3FAS: An Accurate and Robust MultiModal Mobile Face Anti-Spoofing System},
author = {Chenqi Kong and Kexin Zheng and Yibing Liu and Shiqi Wang and Anderson Rocha and Haoliang Li},
journal= {arXiv preprint arXiv:2301.12831},
year = {2024}
}