ForenX:基于多模态大语言模型的可解释 AI 生成图像检测
计算机视觉与模式识别
2025-08-05 v1
摘要
生成模型的进步导致 AI 生成的图像在视觉上几乎无法与真实图像区分。尽管众多研究致力于使用分类器检测 AI 生成的图像,但仍存在与人类认知 Forensic 分析之间的差距。我们提出了 ForenX 方法,不仅识别图像的真实性,还能提供与人类思维相呼应的解释。ForenX 采用强大的多模态大语言模型 (MLLM) 来分析和解释 Forensic 线索。此外,我们通过引入专门的 Forensic 提示词,将注意力引导至伪造相关属性,从而克服了标准 MLLM 检测伪造的局限性。这种方法不仅增强了伪造检测的泛化性,还使 MLLM 能够提供准确、相关且全面的解释。此外,我们引入了 ForgReason 数据集,专门用于描述 AI 生成图像中的伪造证据。该数据集通过 LLM 代理与人类标注员的合作筛选而来,为进一步提升模型性能提供了精细化数据。我们展示了即使有限的手动标注也显著提高了解释质量。我们在两个主要基准数据集上评估了 ForenX 的有效性。模型的可解释性通过全面的主观评估得到验证。
引用
@article{arxiv.2508.01402,
title = {ForenX: Towards Explainable AI-Generated Image Detection with Multimodal Large Language Models},
author = {Chuangchuang Tan and Jinglu Wang and Xiang Ming and Renshuai Tao and Yunchao Wei and Yao Zhao and Yan Lu},
journal= {arXiv preprint arXiv:2508.01402},
year = {2025}
}