中文

通过强化微调探索广义跨域人脸防伪的任务求解范式

计算机视觉与模式识别 2025-06-30 v1

摘要

近年来,新型呈现攻击的出现使人脸防伪受到越来越多的关注。然而,现有方法倾向于记忆训练集中的数据模式,导致对不同场景下未知攻击类型的泛化能力较差,且可解释性有限。为应对这些挑战,本文提出一种基于强化微调的人脸防伪方法,激发多模态大语言模型主动思考并学习如何解决防伪任务本身,而不是依赖于对真伪模式的记忆。我们设计了可验证的类别一致性奖励与推理一致性奖励,并采用基于 GRPO 的优化策略,引导模型从多角度探索推理策略以最大化期望奖励。因此,通过迭代的试错学习并仅保留高奖励轨迹,模型从庞大的解空间中提炼出高度可泛化的决策规则,从而有效应对跨域人脸防伪任务。大量实验结果表明,我们的方法取得了 SOTA 的跨域泛化性能。它能够很好地泛化到未见目标域中多样化的未知攻击类型,同时为其真伪决策提供可解释的推理,且无需劳动密集型的文本标注用于训练。

关键词

引用

@article{arxiv.2506.21895,
  title  = {Exploring Task-Solving Paradigm for Generalized Cross-Domain Face Anti-Spoofing via Reinforcement Fine-Tuning},
  author = {Fangling Jiang and Qi Li and Weining Wang and Gang Wang and Bing Liu and Zhenan Sun},
  journal= {arXiv preprint arXiv:2506.21895},
  year   = {2025}
}