中文

语义操控定位

计算机视觉与模式识别 2026-04-14 v1 人工智能

摘要

图像操控定位(IML)旨在识别图像中被编辑的区域。然而, 随着现代图像编辑和生成模型的广泛应用, 许多操控不再呈现明显的低层次痕迹。相反, 它们常涉及对对象属性、状态或关系进行细微但具有意义的编辑, 同时保持高度一致的背景内容。这使得依赖痕迹检测的传统 IML 方法变得不够有效。为此, 我们提出了语义操控定位(SML),这是一项新任务,聚焦于定位显著改变图像解释的细微语义编辑。我们进一步构建了一个基于语义驱动的操控管道,配备像素级注释的专用细粒度基准。基于此任务, 我们提出了 TRACE(Targeted Reasoning of Attributed Cognitive Edits),一个端到端框架,通过三个逐步耦合的组件来建模语义敏感性:语义锚定、语义扰动感知和语义约束推理。具体而言, TRACE 首先识别支持图像理解的语义意义区域, 然后注入扰动敏感的频率线索以捕捉在强视觉一致性下的细微编辑, 最后通过对语义内容和语义范围的联合推理来验证候选区域。大量实验表明, TRACE 在我们的基准上 consistently 超过现有 IML 方法, 产生更完整、更紧凑且语义连贯的定位结果。这些结果表明, 超越基于痕迹的定位是必要的, 为复杂语义编辑场景下的图像取证提供了新方向。

关键词

引用

@article{arxiv.2604.10132,
  title  = {Semantic Manipulation Localization},
  author = {Zhenshan Tan and Chenhan Lu and Yuxiang Huang and Ziwen He and Xiang Zhang and Yuzhe Sha and Xianyi Chen and Tianrun Chen and Zhangjie Fu},
  journal= {arXiv preprint arXiv:2604.10132},
  year   = {2026}
}