中文

在多模态大语言模型中利用思维链推理进行人脸反欺骗

计算机视觉与模式识别 2026-03-03 v3

摘要

人脸反欺骗(FAS)在防御打印攻击、屏幕重放和 3D 面具等呈现攻击时通常依赖于单一视觉模态,导致其在跨设备、跨环境和跨攻击类型上的泛化能力有限。同时,多模态大语言模型(MLLMs)近期在图像-文本理解和语义推理方面取得了突破,这表明将视觉和语言的协同推理集成到 FAS 中可以大幅提升鲁棒性和可解释性。然而,缺乏高质量的视觉-语言多模态数据集一直是一个关键瓶颈。为解决这一问题,我们引入了 FaceCoT(Face Chain-of-Thought),这是首个专为 FAS 定制的大规模视觉问答(VQA)数据集。FaceCoT 涵盖 14 种欺骗攻击类型,并通过高质量的 CoT VQA 标注丰富了模型学习。同时,我们开发了一个通过强化学习优化的描述模型来扩展数据集并提升标注质量。此外,我们引入了 CoT 增强渐进学习(CEPL)策略,以更好地利用 CoT 数据并提升模型在 FAS 任务上的性能。大量实验表明,使用 FaceCoT 和 CEPL 训练的模型在多个基准数据集上优于 SOTA 方法。

关键词

引用

@article{arxiv.2506.01783,
  title  = {Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing},
  author = {Honglu Zhang and Zhiqin Fang and Ningning Zhao and Saihui Hou and Long Ma and Renwang Pei and Zhaofeng He},
  journal= {arXiv preprint arXiv:2506.01783},
  year   = {2026}
}

备注

Accepted to CVPR2026