DEAL-300K:基于扩散模型的图像编辑区域定位数据集
计算机视觉与模式识别
2025-12-01 v1
摘要
基于扩散模型的图像编辑已使语义层面的图像编辑变得易于实现,但也使得难以定位的逼真局部伪造成为可能。现有基准主要关注生成图像的二值检测或手动编辑区域的定位,无法反映扩散模型编辑的特性——这些编辑常常与原始内容平滑地融合在一起。我们提出了扩散模型图像编辑区域定位数据集(DEAL-300K),这是一套规模超过30万张标注图像的数据集,用于扩散模型图像编辑区域定位(DIML)。我们通过使用多模态大语言模型生成编辑指令,利用无掩模扩散编辑器生成处理后的图像,并通过主动学习变更检测管道获取像素级标注。基于该数据集,我们提出一种定位框架,采用冻结视觉基础模型(VFM)结合多频率提示调优(MFPT)来捕获编辑区域的语义和频率域线索。在DEAL-300K上训练后,我们的方法在测试集上获得了82.56%的像素级F1分数,在外部CoCoGlide基准上达到80.97%,为未来DIML研究提供了强大的基线和实用基础。数据集可通过 https://github.com/ymhzyj/DEAL-300K 访问。
引用
@article{arxiv.2511.23377,
title = {DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline},
author = {Rui Zhang and Hongxia Wang and Hangqing Liu and Yang Zhou and Qiang Zeng},
journal= {arXiv preprint arXiv:2511.23377},
year = {2025}
}
备注
13pages,12 figures