基于 MLLM 中 grounded reasoning 的 AI 生成图像可解释可靠检测
计算机视觉与模式识别
2025-06-10 v1 人工智能
计算与语言
摘要
图像生成技术的快速发展加剧了对可解释且稳健检测方法的需求。虽然现有方法常实现高准确率,但通常作为黑箱运行,无法提供人类可理解的解释。多模态大型语言模型(MLLM)虽然原本不用于 forgery 检测,却展现出强大的分析和推理能力。经过适当微调后,它们能够有效识别 AI 生成图像并提供有意义的解释。然而,现有 MLLM 仍面临幻觉问题,常未能将视觉解释与实际图像内容及人类推理一致。为弥合这一差距,我们构建了一个包含 AI 生成图像的数据集,标注了边界框和描述性说明,以突出合成人工影,为人类对齐的视觉-文本 grounded reasoning 奠定基础。随后,我们通过多阶段优化策略对 MLLM 进行微调,逐步平衡准确检测、视觉局部化和连贯文本解释的目标。 resulting model 在检测 AI 生成图像和局部化视觉缺陷方面均表现出优越性能,显著优于基线方法。
引用
@article{arxiv.2506.07045,
title = {Interpretable and Reliable Detection of AI-Generated Images via Grounded Reasoning in MLLMs},
author = {Yikun Ji and Hong Yan and Jun Lan and Huijia Zhu and Weiqiang Wang and Qi Fan and Liqing Zhang and Jianfu Zhang},
journal= {arXiv preprint arXiv:2506.07045},
year = {2025}
}