中文

通过渐进式理解提升弱监督指代图像分割

计算机视觉与模式识别 2024-12-05 v3

摘要

本文探讨了弱监督指代图像分割(WRIS)问题,并聚焦于一个具有挑战性的设定:直接从图像-文本对中学习目标定位。我们注意到,输入文本描述通常已包含如何定位目标对象的详细信息,并且观察到人类通常遵循逐步理解的过程(即,渐进地利用目标相关属性和关系作为线索)来识别目标对象。因此,我们提出了一种新颖的渐进式理解网络(PCNet),以利用输入描述中与目标相关的文本线索,逐步定位目标对象。具体来说,我们首先使用大型语言模型(LLM)将输入文本描述分解为短短语。这些短短语作为目标相关线索,分多个阶段输入到条件指代模块(CRM)中,从而以多阶段方式更新指代文本嵌入并增强用于目标定位的响应图。基于CRM,我们进一步提出了一种区域感知收缩(RaS)损失,以约束视觉定位在不同阶段以由粗到细的方式逐步进行。最后,我们引入了一种实例感知消歧(IaD)损失,通过区分同一图像上不同指代文本生成的、重叠的响应图来抑制实例定位歧义。大量实验表明,我们的方法在三个常用基准测试上优于最先进的方法。

关键词

引用

@article{arxiv.2410.01544,
  title  = {Boosting Weakly-Supervised Referring Image Segmentation via Progressive Comprehension},
  author = {Zaiquan Yang and Yuhao Liu and Jiaying Lin and Gerhard Hancke and Rynson W. H. Lau},
  journal= {arXiv preprint arXiv:2410.01544},
  year   = {2024}
}

备注

Accepted to NeurIPS2024