从直觉到调查:面向通用人脸防欺骗的工具增强型推理大语言模型框架
高能物理 - 唯象学
2026-04-10 v2 高能物理 - 实验
摘要
人脸识别仍然脆弱于呈现攻击,亟需鲁健的人脸防欺骗(FAS)解决方案。最近的基于大语言模型的FAS方法将二元分类任务重新表述为生成简短文字描述,以提高跨域泛化性。然而,其泛化性仍有限,因为此类描述主要捕获直觉语义线索(如面具轮廓),难以感知细粒度视觉模式。为此,我们将外部视觉工具纳入大语言模型,以鼓励对细微欺骗线索进行深入调查。具体而言,我们提出工具增强推理FAS(TAR-FAS)框架,将FAS任务重新表述为带视觉工具的链式思维(CoT-VT)范式,允许大语言模型以直觉观察为起点,适应性地调用外部视觉工具进行细粒度调查。为此,我们设计了工具增强数据标注管道,构建了包含多轮工具使用推理轨迹的ToolFAS-16K数据集。进一步,我们引入工具感知FAS训练管道,其中多样化工具组相对政策优化(DT-GRPO)使模型能够自主学习高效工具使用。大量实验在严苛的一种对十一跨域协议下表明,TAR-FAS在保持提供可信赖欺骗检测细粒度视觉调查的同时,实现了SOTA性能。
引用
@article{arxiv.2603.01037,
title = {Quark-diquark effective mass formalism for heavy baryon spectroscopy},
author = {Binesh Mohan and Rohit Dhir},
journal= {arXiv preprint arXiv:2603.01037},
year = {2026}
}
备注
36 pages, 3 figures, 8 tables, Revised version