ManipShield:图像操纵检测、定位与解释的统一框架
计算机视觉与模式识别
2026-01-21 v3
摘要
随着生成模型的快速发展,强大的图像编辑方法已远超传统深度伪造技术,实现多样且高度逼真的图像操纵,为操纵检测带来新挑战。现有图像操纵检测与定位(IMDL)基准受限于内容多样性不足、生成模型覆盖范围窄、可解释性不足,制约了当前操纵检测方法的泛化与解释能力。为此,我们引入ManipBench——一个聚焦AI编辑图像的大规模图像操纵检测与定位基准,包含45万+个被25个最先进图像编辑模型生成的操纵图像,覆盖12类操纵类型,其中10万张图像进一步标注了边界框、判断线索及文本解释,支持可解释检测。基于ManipBench,我们提出ManipShield——一个基于多模态大语言模型(MLLM)的全能方案,利用对比LoRA微调和任务特定解码器实现统一的图像操纵检测、定位与解释。大量实验表明,ManipShield在ManipBench及多个公开数据集上实现最先进性能,展现出对未见操纵模型的强大泛化能力。ManipBench与ManipShield将在发表后公开释放。
引用
@article{arxiv.2511.14259,
title = {ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation},
author = {Zitong Xu and Huiyu Duan and Xiaoyu Wang and Zhaolin Cai and Kaiwei Zhang and Qiang Hu and Jing Liu and Xiongkuo Min and Guangtao Zhai},
journal= {arXiv preprint arXiv:2511.14259},
year = {2026}
}