中文

基于得分模型的通用图像操纵定位

计算机视觉与模式识别 2026-05-19 v1

摘要

随着合成媒体的快速发展,图像操纵定位(IML)已成为多媒体法学领域确保数字内容完整性的关键组件。然而,泛化仍是核心挑战,因为现有判别方法通常学习固定的决策边界,倾向于过拟合特定训练工件,无法适应未见的操纵类型。为此,我们提出DiffIML,一种引入得分基生成模型的新框架。与直接估计硬边界不同,DiffIML逼近得分函数(对数似然的梯度),以捕捉掩码分布的固有几何拓扑。该范式利用结构先验条件,通过迭代从噪声中恢复连贯的掩码,从而规避判别模型的脆弱性。在此表述下,扩散模型可作为所学习得分函数的有效数值求解器。为确保实用性,我们分别解决标准扩散的效率和稳定性瓶颈:(1)采用轻量级掩码特定变分自编码器进行快速潜在空间处理,以及解耦的轻量级去噪U-Net;(2)边缘监督和误差先验以缓解抽样期间的误差累积。对八个非生成和三个生成基准进行大量实验测试,证明DiffIML在 diverse unseen 数据集上 consistently 优于最先进的方法,实现显著的泛化改进。代码将公开提供。

关键词

引用

@article{arxiv.2605.16879,
  title  = {Towards Generalized Image Manipulation Localization via Score-based Model},
  author = {Yunfei Wang and Bo Du and Zhe Yang and Xin Liu and Zhiyu Lin and Tianxin Xu and Ji-Zhe Zhou},
  journal= {arXiv preprint arXiv:2605.16879},
  year   = {2026}
}

备注

Accepted to ICMR 2026. 9 pages, 4 figures