中文

SAPL:CLIP 中语义无关提示学习用于弱监督图像操纵定位

计算机视觉与模式识别 2026-01-13 v1 人工智能

摘要

恶意图像操纵威胁公共安全,需高效的定位方法。现有方法依赖高成本的像素级标注,训练昂贵。现有弱监督方法仅依赖图像级二元标签,关注全局分类,常忽视对精确定位至关重要的局部边缘线索。我们观察到,操纵边界处的特征变化远大于内部区域。为解决这一问题,我们提出语义无关提示学习(SAPL)于 CLIP,学习文本提示以有意编码非语义的、以边界为中心的线索,以便 CLIP 的多模态相似性突出操纵边缘而非高层对象语义。SAPL 组合两个互补模块:边缘感知上下文提示学习(ECPL)和层次边缘对比学习(HECL),以利用文本和视觉空间中的边缘信息。 proposed ECPL 利用边缘增强的图像特征通过注意力机制生成可学习的文本提示,将语义无关信息嵌入文本特征,以引导 CLIP 关注操纵边缘。proposed HECL 提取真实和操纵边缘块,并利用对比学习提高真实边缘块与操纵边缘块之间的辨识度。最后,我们从相似图中预测操纵区域。广泛的实验表明,SAPL 在多个公开基准上显著优于现有方法,实现了最先进的定位性能。

关键词

引用

@article{arxiv.2601.06222,
  title  = {SAPL: Semantic-Agnostic Prompt Learning in CLIP for Weakly Supervised Image Manipulation Localization},
  author = {Xinghao Wang and Changtao Miao and Dianmo Sheng and Tao Gong and Qi Chu and Nenghai Yu and Quanchen Zou and Deyue Zhang and Xiangzheng Zhang},
  journal= {arXiv preprint arXiv:2601.06222},
  year   = {2026}
}