中文

SIGMA: 基于语义差异与指令定位的掩码标注器用于文本驱动图像篡改定位

计算机视觉与模式识别 2026-05-28 v1

摘要

文本驱动的图像编辑技术发展迅速,但可靠地定位这些篡改需要在大规模像素标注数据集上训练的图像篡改定位(IML)模型,而目前仍缺乏低成本获取此类训练数据的方法。我们观察到这些数据实际上已经以另一种形式存在:公开的编辑数据集包含数百万个与IML训练样本结构相同的(原始图像,编辑后图像)对,只是缺少像素级掩码。自动恢复这些掩码并非易事:像素差分法会被扩散过程在所有像素上引入的扰动所淹没,而仅基于指令的定位只能定位提示词所描述的内容,会遗漏编辑器的意外副作用。我们提出了SIGMA(基于语义差异与指令定位的掩码标注器),它在视觉基础骨干网络中进行语义特征差分,并通过双向跨模态精炼将指令衍生的空间先验注入到视觉流中,从而在编辑器忠实实现用户意图时,放大预期编辑区域的差异信号。SIGMA通过两个互补阶段进行训练:第一阶段使用修复掩码进行监督;第二阶段通过VAE往返噪声校准、EMA自训练和编辑-噪声解耦损失来弥合扩散域偏移。在五个基准测试上,SIGMA优于现有的自动掩码生成器(F1分数提升+12.20%,IoU提升+11.16%)。当应用于公开编辑语料库时,它生成了一个约110万样本的IML训练集,该训练集在五个数据集上将六种不同检测器的F1分数平均提升了+18.34%,将以前未使用的编辑数据转化为IML的模型无关监督资源。论文被接收后,我们将立即发布完整的代码库。

关键词

引用

@article{arxiv.2605.27924,
  title  = {SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization},
  author = {Peiyu Zhuang and Jianquan Yang and Haodong Li and Zhuoying Cai and Ruitao Xie and Jishen Zeng and Baoying Chen and Jiwu Huang and Xiaochun Cao},
  journal= {arXiv preprint arXiv:2605.27924},
  year   = {2026}
}