中文

LGD:利用生成描述进行零样本指涉图像分割

计算机视觉与模式识别 2025-05-02 v2

摘要

零样本指涉图像分割旨在基于指涉表达式定位和分割目标区域,但主要挑战在于在没有训练的情况下,对视觉与文本模态之间的语义进行对齐和匹配。以往方法通过利用视觉-语言模型和掩码提议网络进行区域-文本匹配来解决此挑战,但可能导致目标定位错误,由于自由形式指涉表达式固有的歧义性和多样性。为缓解此问题,我们提出LGDD(利用生成描述),一个框架利用多模态大型语言模型的高级语言生成能力来增强视觉-语言模型中区域-文本匹配的性能。具体而言,我们首先设计两种类型的提示符,属性提示符和环境提示符,引导多模态大型语言模型生成与指涉对象关键属性相关的描述和周环境细节的描述,分别称为属性描述和环境描述。其次,引入三种视觉-文本匹配得分来评估实例级视觉特征与文本特征之间的相似性,从而确定与指涉表达式最相关的掩码。该方法在RefCOCO、RefCOCO+和RefCOCOg三个公开数据集上实现了新的状态最佳性能,相较于先前方法,在oIoU和mIoU上分别提升了最高达9.97%和11.29%。

关键词

引用

@article{arxiv.2504.14467,
  title  = {LGD: Leveraging Generative Descriptions for Zero-Shot Referring Image Segmentation},
  author = {Jiachen Li and Qing Xie and Renshu Gu and Jinyu Xu and Yongjian Liu and Xiaohan Yu},
  journal= {arXiv preprint arXiv:2504.14467},
  year   = {2025}
}