中文

从被动感知到主动记忆:基于粗粒度注释驱动的图像操纵局部化弱监督框架

计算机视觉与模式识别 2025-11-26 v1 人工智能

摘要

图像操纵局部化(IML)面临着最小化标注成本与实现精细局部化精度之间的根本性权衡。现有的全监督IML方法高度依赖稠密像素级掩码标注,这限制了其在大规模数据集或实际部署中的可扩展性。相比之下,大多数现有的弱监督IML方法基于图像级别标签,显著降低了标注工作量,但通常缺乏精确的空间局部化能力。为解决这一困境,本文提出了BoxPromptIML,一种新颖的弱监督IML框架,有效平衡了标注成本与局部化性能。具体而言,本文提出了一种粗粒度区域标注策略,能够以较低成本生成相对精确的操纵掩码。为提高模型效率并便于部署,我们进一步设计了一种高效轻量级学生模型,使其通过从基于Segment Anything Model(SAM)的固定教师模型进行知识蒸馏,学习进行精细的局部化。此外,灵感来自人类潜意识记忆机制,我们的特征融合模块采用双导向策略,主动地将被调召回的原型模式与来自输入的实时观察线索进行 contextualized 化。该策略实现了知识的动态再现过程,其中长期记忆被适应当前图像的特定上下文,从而显著提升了局部化精度和鲁棒性。在广泛的分布内和分布外数据集上进行的大量实验表明,BoxPromptIML在保持强大泛化能力、低标注成本和高效部署特性的同时,超越或媲美全监督模型。

关键词

引用

@article{arxiv.2511.20359,
  title  = {From Passive Perception to Active Memory: A Weakly Supervised Image Manipulation Localization Framework Driven by Coarse-Grained Annotations},
  author = {Zhiqing Guo and Dongdong Xi and Songlin Li and Gaobo Yang},
  journal= {arXiv preprint arXiv:2511.20359},
  year   = {2025}
}

备注

Accepted by AAAI 2026