中文

用于弱监督语义分割的问答跨语言图像匹配

计算机视觉与模式识别 2024-01-19 v1

摘要

类激活图 (CAM) 已成为弱监督语义分割 (WSSS) 的一种流行工具,允许仅使用图像级标签来定位图像中的目标区域。然而,现有的 CAM 方法存在目标区域激活不足和背景区域误激活的问题,这是因为缺乏详细的监督会阻碍模型将图像作为一个整体来理解的能力。在本文中,我们提出了一种用于 WSSS 的新型问答跨语言图像匹配框架 (QA-CLIMS),利用视觉语言基础模型来最大化对图像的基于文本的理解,并指导激活图的生成。首先,通过问答提示工程 (QAPE) 向 VQA (Visual Question Answering) 模型提出一系列精心设计的问题,以生成适应查询图像的前景目标对象和背景语料库。然后,我们采用对比学习,在区域图像文本对比 (RITC) 网络中将获得的前景和背景区域与生成的语料库进行比较。我们的方法利用来自开放词汇的丰富文本信息作为额外监督,使模型能够生成具有更完整目标区域的高质量 CAM,并减少背景区域的误激活。我们进行了广泛的分析以验证所提出的方法,并表明我们的方法在 PASCAL VOC 2012 和 MS COCO 数据集上均表现出 state-of-the-art 的性能。代码可在以下地址获取:https://github.com/CVI-SZU/QA-CLIMS

关键词

引用

@article{arxiv.2401.09883,
  title  = {Question-Answer Cross Language Image Matching for Weakly Supervised Semantic Segmentation},
  author = {Songhe Deng and Wei Zhuo and Jinheng Xie and Linlin Shen},
  journal= {arXiv preprint arXiv:2401.09883},
  year   = {2024}
}

备注

ACM MM 2023