LEGION:用于合成图像检测的学习性 grounding 与解释
计算机视觉与模式识别
2025-03-20 v1
摘要
生成技术的快速发展成为双刃剑。虽然提供了强大的工具以提升便利性,但也带来了显著的社会关切。作为防御者,当前的合成图像检测方法往往缺乏 artifact-level 的文本可解释性,且过于关注图像操纵检测;当前数据集通常 suffer于生成器已过时且缺乏细粒度标注。在本文中,我们提出了 SynthScars 数据集,包含 12,236 张高质量且多样化的合成图像,配有人类专家标注。数据集包含 4 种不同的图像内容类型、3 类 artifact 类别,以及覆盖像素级分割、详细文本解释和 artifact 类别标签的细粒度标注。此外,我们提出了 LEGION (LEarning to Ground and explain for Synthetic Image detectiON),一个基于多模态大语言模型 (MLLM) 的图像伪造分析框架,集成了 artifact 检测、分割和解释。基于此能力,我们进一步探索 LEGION 作为控制器,将其集成到图像细化管道中,以引导生成更高质量、更真实的图像。广泛的实验表明,LEGION 在多个基准测试中优于现有方法,尤其在 SynthScars 上相对于第二名的传统专家在 mIoU 上提升 3.31%,F1 分数提升 7.75%。此外,受其指导生成的细化图像在与人类偏好的一致性方面表现更佳。代码、模型和数据集将公开释放。
引用
@article{arxiv.2503.15264,
title = {LEGION: Learning to Ground and Explain for Synthetic Image Detection},
author = {Hengrui Kang and Siwei Wen and Zichen Wen and Junyan Ye and Weijia Li and Peilin Feng and Baichuan Zhou and Bin Wang and Dahua Lin and Linfeng Zhang and Conghui He},
journal= {arXiv preprint arXiv:2503.15264},
year = {2025}
}
备注
Project Page: https://opendatalab.github.io/LEGION