基于视觉语言协同推理框架的弱监督图像伪造局部化
计算机视觉与模式识别
2025-08-05 v1 人工智能
摘要
图像伪造局部化旨在精确识别图像中被篡改的区域,但通常依赖昂贵的像素级标注。为缓解此类标注负担,近年来出现了弱监督图像伪造局部化(WSIFL),然而现有方法仍实现有限的局部化性能,因为它们主要利用图像内部一致性线索,缺乏外部语义指导来补偿弱监督。在本文中,我们提出了 ViLaCo,一种视觉语言协同推理框架,通过引入从预训练视觉语言模型(VLMs)提炼的辅助语义监督,实现仅使用图像级标签即可进行精确像素级局部化。具体而言,ViLaCo 首先通过视觉语言特征建模网络整合语义知识,该网络联合提取文本和视觉先验。随后,一个自适应视觉语言推理网络通过相互作用对齐文本语义与视觉特征,生成语义对齐的表示。这些表示随后被传递到双预测头中,其中粗头执行图像级分类,细头生成像素级局部化掩码,从而弥合弱监督与细粒度局部化之间的差距。此外,引入对比块一致性模块以聚类被篡改特征并分离真实特征,促进更可靠的伪造鉴别。广泛的实验表明,ViLaCo 在多个公开数据集上显著优于现有 WSIFL 方法,在检测和局部化准确性方面实现了最先进的性能。
引用
@article{arxiv.2508.01338,
title = {Weakly-Supervised Image Forgery Localization via Vision-Language Collaborative Reasoning Framework},
author = {Ziqi Sheng and Junyan Wu and Wei Lu and Jiantao Zhou},
journal= {arXiv preprint arXiv:2508.01338},
year = {2025}
}