中文

FakeScope:面向透明 AI 生成图像取证的大型多模态专家模型

计算机视觉与模式识别 2026-03-17 v2

摘要

生成式人工智能(AI)的快速且无节制的发展是一把双刃剑。它在实现前所未有的创造力的同时,也助长了高度逼真内容的生成,破坏了社会信任。随着图像生成技术日益成熟,检测合成图像不再仅仅是一项二元任务——它需要可解释的方法来增强可信度和透明度。然而,现有的检测模型主要侧重于分类,提供的解释性见解有限。为了解决这些局限性,我们提出了 FakeScope,一个专为 AI 生成图像取证定制的大型多模态模型(LMM),它不仅能高精度识别合成图像,还能提供丰富的依查询而定的取证见解。我们方法的基础是 FakeChain,这是一个包含基于视觉痕迹证据的结构化取证推理的大规模数据集,通过人机协作框架构建。然后我们开发了 FakeInstruct,迄今为止最大的多模态指令微调数据集,包含两百万条视觉指令,向 LMM 灌输细致入微的取证意识。在 FakeInstruct 的赋能下,FakeScope 在封闭式和开放式取证场景中均实现了 SOTA 性能。它能够准确区分合成图像、提供连贯的解释、讨论细粒度的伪造痕迹,并提出可行的增强策略。值得注意的是,尽管仅在定性硬标签上进行训练,FakeScope 通过我们提出的基于 token 的概率估计策略展示了卓越的零样本定量检测能力。此外,它在未见过的图像生成器上表现出稳健的泛化能力,并在野外场景下可靠运行。

关键词

引用

@article{arxiv.2503.24267,
  title  = {FakeScope: Large Multimodal Expert Model for Transparent AI-Generated Image Forensics},
  author = {Yixuan Li and Yu Tian and Yipo Huang and Wei Lu and Shiqi Wang and Weisi Lin and Anderson Rocha},
  journal= {arXiv preprint arXiv:2503.24267},
  year   = {2026}
}