中文

InstructFLIP:探索面向人脸防欺骗的统一视觉语言模型

计算机视觉与模式识别 2025-07-31 v2 人工智能 多媒体

摘要

人脸防欺骗(face anti-spoofing, FAS)旨在构建能抵御多样化攻击的鲁棒系统。虽然近期研究主要集中在跨域泛化,但仍面临两个显著挑战:对攻击类型的语义理解有限,以及跨域训练冗余。我们通过集成视觉语言模型(VLM)来增强对视觉输入的感知,以解决第一个挑战。对于第二个挑战,我们采用元域策略学习一个在多个域之间广泛泛化的统一模型。我们提出的 InstructFLIP 是一个新颖的指令调谋框架,利用 VLM 通过文本指导提升泛化能力,仅基于单个域训练。其核心,InstructFLIP 显式地将指令解耦为内容和风格组件,其中基于内容的指令聚焦于欺骗的本质语义,风格-based 指令则考虑与环境和摄像头特征相关的变体。广泛的实验表明,InstructFLIP 通过超越 SOTA 模型在准确率和显著减少跨域 FAS 中训练冗余方面取得显著成效。项目网址为 https://kunkunlin1221.github.io/InstructFLIP。

关键词

引用

@article{arxiv.2507.12060,
  title  = {InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing},
  author = {Kun-Hsiang Lin and Yu-Wen Tseng and Kang-Yang Huang and Jhih-Ciang Wu and Wen-Huang Cheng},
  journal= {arXiv preprint arXiv:2507.12060},
  year   = {2025}
}

备注

Accepted by MM'25