中文

FakeVLM-R1:通过 CoT 实现物理定律内化用于合成图像检测

计算机视觉与模式识别 2026-05-29 v1

摘要

生成式人工智能技术的发展推动了合成图像的视觉逼真度达到了前所未有的水平。虽然当前基于大型多模态模型 (LMM) 的可解释检测方法取得了一定进展,但它们仍依赖于从大量伪造数据中获得的模仿学习,因而缺乏真正的因果推理能力,容易产生解释幻觉。为克服这一瓶颈,我们提出了 FakeVLM-R1,旨在赋予模型在执行合成图像检测任务时具备类似人的批判性思维能力。该框架基于监督微调 (SFT),集成了群体相对策略优化 (GRPO) 与批判性思维链 (CoT) 机制。在推理阶段,模型执行“双向辩证推理”过程:在提出伪造假设的同时,必须调用物理常识构建真实性反证。此外,我们构建了高质量的 FakeClue++ 数据集,广泛引入由真实图像物理定律指导的注释,为模型提供统一的真实性锚点。实验表明,FakeVLM-R1 在多个基准测试中实现了当前评估模型的 SOTA 性能。它不仅实现了高精度、逻辑可解释的检测,还解决了现有方法对真实图像过度否定的偏差,显示出对扰动的泛化和鲁棒性。

关键词

引用

@article{arxiv.2605.30062,
  title  = {FakeVLM-R1: Internalizing Physical Laws via CoT for Synthetic Image Detection},
  author = {Leqi Zhu and Junyan Ye and Kaiqing Lin and Zhiyuan Yan and Conghui He and Weijia Li},
  journal= {arXiv preprint arXiv:2605.30062},
  year   = {2026}
}