中文

基于人工智能生成内容的合成图像检测与制图解释

计算机视觉与模式识别 2025-10-17 v2

摘要

随着人工智能生成内容(AIGC)技术的快速发展,合成图像在日常生活中变得愈发普遍,为真实性评估和检测带来新挑战。尽管现有方法在评估图像真实性和定位伪造方面效果良好,但这些方法往往缺乏人类可解释性,且未充应应对日益复杂的合成数据的挑战。为此,我们引入 FakeVLM,一个专为通用合成图像和 DeepFake 检测任务设计的大型多模态模型。FakeVLM 不仅在区分真实与假图像方面表现出色,还能提供对图像制图的清晰、自然语言解释,从而增强可解释性。此外,我们提出 FakeClue,一个包含超过 10 万张跨七个类别的图像的数据集,标注了细粒度的制图线索。FakeVLM 在多个数据集上的广泛评估表明,其性能媲美专家模型,无需额外分类器,成为合成数据检测的稳健解决方案。

关键词

引用

@article{arxiv.2503.14905,
  title  = {Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation},
  author = {Siwei Wen and Junyan Ye and Peilin Feng and Hengrui Kang and Zichen Wen and Yize Chen and Jiang Wu and Wenjun Wu and Conghui He and Weijia Li},
  journal= {arXiv preprint arXiv:2503.14905},
  year   = {2025}
}