从直觉到调查:面向通用人脸防欺骗的工具增强型推理 MLLM 框架
计算机视觉与模式识别
2026-03-23 v2 人工智能
摘要
人脸识别因素吊诡而受到presentation attack的威胁,迫切需要稳健的人脸防欺骗(FAS)解决方案。近期基于MLLM的FAS方法将二元分类任务重新表述为生成简短文字描述,以提高跨域泛化性。但这些方法的泛化性仍有限,因为此类描述主要捕获直观语义线索(如口罩轮廓),而难以感知细粒度的视觉模式。为此,我们将外部视觉工具纳入MLLM,以鼓励对细微欺骗线索进行深入调查。具体而言,我们提出了工具增强型推理FAS(TAR-FAS)框架,将FAS任务重新表述为带视觉工具的链式思维(CoT-VT)范式,使MLLM能够以直观观察为起点,适应性地调用外部视觉工具进行细粒度调查。为此,我们设计了工具增强的数据标注管线,构建了包含多轮工具使用推理轨迹的ToolFAS-16K数据集。此外,我们引入了工具感知的FAS训练管线,其中Diverse-Tool Group Relative Policy Optimization(DT-GRPO)使模型能够自主学习高效的工具使用。大量实验在具有挑战性的十一对一跨域协议下表明,TAR-FAS实现了SOTA性能,同时为可信赖的欺骗检测提供了细粒度视觉调查。
引用
@article{arxiv.2603.01038,
title = {From Intuition to Investigation: A Tool-Augmented Reasoning MLLM Framework for Generalizable Face Anti-Spoofing},
author = {Haoyuan Zhang and Keyao Wang and Guosheng Zhang and Haixiao Yue and Zhiwen Tan and Siran Peng and Tianshuo Zhang and Xiao Tan and Kunbin Chen and Wei He and Jingdong Wang and Ajian Liu and Xiangyu Zhu and Zhen Lei},
journal= {arXiv preprint arXiv:2603.01038},
year = {2026}
}
备注
Accepted by CVPR 2026