中文

重访真实操作场景下的图像篡改定位

计算机视觉与模式识别 2026-04-13 v3

摘要

随着大模型简化了劳动密集型的操作流程,当今真实场景中的图像操作往往涉及复杂的多步编辑过程,一系列编辑操作共同生成具有欺骗性的图像。然而现有的图像篡改定位方法对操作过程无感知,采用单次预测范式直接生成定位掩码,未对底层编辑步骤建模。这种单次范式将高维组合空间压缩为单一二值掩码,导致严重的维度坍缩,迫使模型丢弃关键的结构线索,最终导致过拟合和泛化能力退化。为解决此问题,我们首次将图像篡改定位重新表述为条件序列预测任务,提出了RITA框架。RITA以有序方式逐层预测被操作区域,将每一步的预测作为下一步的条件,从而显式建模编辑操作之间的时间依赖性和层次结构。为实现训练与评估,我们合成了多步操作数据并构建了新的基准HSIM。我们进一步提出了HSS指标用于评估序列顺序和层次对齐。大量实验表明:1)RITA在传统基准上达到了SOTA的泛化性和鲁棒性;2)尽管显式建模多步序列但仍保持计算效率;3)为层次化、面向过程的篡改定位奠定了可行基础。代码和数据集可在 https://github.com/scu-zjz/RITA 获取。

关键词

引用

@article{arxiv.2509.20006,
  title  = {Revisiting Image Manipulation Localization under Realistic Manipulation Scenarios},
  author = {Xuekang Zhu and Ji-Zhe Zhou and Kaiwen Feng and Chenfan Qu and Xiwen Wang and Yunfei Wang and Liting Zhou and Jian Liu},
  journal= {arXiv preprint arXiv:2509.20006},
  year   = {2026}
}