一种基于全局亲和力的视觉表征引导弱监督显著目标检测框架
计算机视觉与模式识别
2023-06-12 v2
摘要
全监督显著目标检测 (SOD) 方法在性能上已取得可观进展,但这些模型严重依赖昂贵的像素级标注。近来,为在标注负担与性能间取得权衡,基于涂鸦的 SOD 方法受到越来越多的关注。以往的基于涂鸦的模型仅依据信息有限的 SOD 训练数据直接执行 SOD 任务,它们极难理解图像并进一步实现优越的 SOD 任务。本文中,我们提出了一种简单而有效的、由富含上下文语义知识的通用视觉表征引导的基于涂鸦的 SOD 框架。这些通用视觉表征由基于大规模无标注数据集的自监督学习生成。我们的框架由任务相关编码器、通用视觉模块和信息整合模块组成,以高效地将通用视觉表征与任务相关特征结合,基于理解图像上下文关联来执行 SOD 任务。同时,我们提出一种新的全局语义亲和力损失,引导模型感知显著目标的全局结构。在五个公开基准数据集上的实验结果表明,我们的方法仅利用涂鸦标注且不引入任何额外标签,优于最先进的弱监督 SOD 方法。具体而言,在所有数据集上它均优于先前最佳的基于涂鸦的方法,最大 F 值平均提升 5.5%、平均 F 值提升 5.8%、MAE 提升 24%、E 值提升 3.1%。此外,我们的方法取得了与最先进全监督模型相当甚至更优的性能。
引用
@article{arxiv.2302.10697,
title = {A Visual Representation-guided Framework with Global Affinity for Weakly Supervised Salient Object Detection},
author = {Binwei Xu and Haoran Liang and Weihua Gong and Ronghua Liang and Peng Chen},
journal= {arXiv preprint arXiv:2302.10697},
year = {2023}
}