基于人工智能生成内容的合成图像检测与制图解释
计算机视觉与模式识别
2025-10-17 v2
摘要
随着人工智能生成内容(AIGC)技术的快速发展,合成图像在日常生活中变得愈发普遍,为真实性评估和检测带来新挑战。尽管现有方法在评估图像真实性和定位伪造方面效果良好,但这些方法往往缺乏人类可解释性,且未充应应对日益复杂的合成数据的挑战。为此,我们引入 FakeVLM,一个专为通用合成图像和 DeepFake 检测任务设计的大型多模态模型。FakeVLM 不仅在区分真实与假图像方面表现出色,还能提供对图像制图的清晰、自然语言解释,从而增强可解释性。此外,我们提出 FakeClue,一个包含超过 10 万张跨七个类别的图像的数据集,标注了细粒度的制图线索。FakeVLM 在多个数据集上的广泛评估表明,其性能媲美专家模型,无需额外分类器,成为合成数据检测的稳健解决方案。
引用
@article{arxiv.2503.14905,
title = {Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation},
author = {Siwei Wen and Junyan Ye and Peilin Feng and Hengrui Kang and Zichen Wen and Yize Chen and Jiang Wu and Wenjun Wu and Conghui He and Weijia Li},
journal= {arXiv preprint arXiv:2503.14905},
year = {2025}
}