基于类别感知自动标注的网页监督图像操纵局部化
计算机视觉与模式识别
2025-12-29 v2
摘要
图像通过图像编辑工具进行的操纵可能误导观众,并对社会安全构成重大风险。然而,准确定位被操纵的图像区域一直具有挑战性,这是由于高质量标注数据的严重稀缺,创建这些数据工作量很大。为此,我们提出了一种通过充分利用网页数据来缓解数据稀缺性的新方法。我们利用来自网页的大量人工制造的图像,以及来自更简单辅助任务(受限图像操纵局部化)自动生成的标注。具体而言,我们引入 CAAAv2,一种基于类别感知、先验特征去噪范式的新型自动标注框架,从而显著降低任务复杂度。为进一步确保标注可靠性,我们提出了 QES,这是一种新型指标,用于过滤低质量标注。将 CAAAv2 和 QES 结合,我们构建了 MIMLv2 数据集,包含 246,212 张人工制造的图像,配有像素级掩码标注。这一规模是现有手工制作数据集(如 IMD20)的 120 倍以上。此外,我们引入了 Object Jitter 技术,通过生成高质量操纵痕迹来进一步增强模型训练。基于这些进展,我们开发了 Web-IML,一个新模型,旨在有效利用网页规模的监督信息来完成图像操纵局部化任务。广泛的实验表明,我们的方法显著缓解了数据稀缺问题,并在多个真实世界伪造基准上显著提高了各种模型的性能。通过提出的网页监督,Web-IML 实现了 31% 的显著性能提升,并超过了之前的最新方法 SparseViT 超过 21.6 个平均 IoU 分数。该数据集和代码将在 https://github.com/qcf-568/MIML 上发布。
引用
@article{arxiv.2508.20987,
title = {Webly-Supervised Image Manipulation Localization via Category-Aware Auto-Annotation},
author = {Chenfan Qu and Yiwu Zhong and Huiguo He and Bin Li and Lianwen Jin},
journal= {arXiv preprint arXiv:2508.20987},
year = {2025}
}