视觉语言模型能否检测并局部化细粒度AI编辑图像?
计算机视觉与模式识别
2025-12-04 v2 人工智能
密码学与安全
摘要
细粒度检测和定位局部图像编辑对于评估内容真实性至关重要,尤其是当现代扩散模型和图像编辑器能够生成高度逼真的操纵时。然而,这一问题面临三个关键挑战:(1)大多数AIGC检测器仅生成全局real-or-fake标签,而不指示编辑发生位置;(2)传统计算机视觉方法的编辑局部化通常依赖高成本的像素级标注;(3)目前没有针对编辑图像检测构建的大规模、现代基准数据集。为解决这些问题,我们开发了一个自动化的数据生成管道,构建了FragFake——一个覆盖多个来源数据集、多样化编辑模型和几种常见编辑类型的大规模AI编辑图像基准。基于FragFake,我们是首次系统性地研究视觉语言模型(VLMs)用于编辑图像分类和编辑区域局部化。我们的实验表明,预训练的VLMs包括GPT4o在该任务上表现不佳,而微调后的模型如Qwen2.5-VL在所有设置下均实现高准确率并显著提升目标精度。我们进一步探索了基于GRPO的RLVR训练,虽在指标上仅带来有限提升,但改善了模型输出的可解释性。消融和迁移分析揭示了数据平衡、训练规模、LoRA秩以及训练域对性能的影响,并突出了跨编辑器和跨数据集泛化的潜力与局限。我们预计此工作将为此领域的后续研究提供坚实基础,激发更多研究工作。
引用
@article{arxiv.2505.15644,
title = {Can VLMs Detect and Localize Fine-Grained AI-Edited Images?},
author = {Zhen Sun and Ziyi Zhang and Zeren Luo and Zhiyuan Zhong and Zeyang Sha and Tianshuo Cong and Zheng Li and Shiwen Cui and Weiqiang Wang and Jiaheng Wei and Xinlei He and Qi Li and Qian Wang},
journal= {arXiv preprint arXiv:2505.15644},
year = {2025}
}
备注
14pages,19 figures