中文

利用全局-局部上下文特征的零样本指称图像分割

计算机视觉与模式识别 2023-04-04 v2 人工智能 计算与语言

摘要

指称图像分割(RIS)旨在根据输入图像中某个区域所对应的指称表达式,找到相应的分割掩码。然而,为该任务收集标注数据集众所周知地昂贵且费力。为克服此问题,我们提出一种简单而有效的零样本指称图像分割方法,利用 CLIP 的预训练跨模态知识。为获得基于输入文本的分割掩码,我们提出一种掩码引导的视觉编码器,捕获输入图像的全局与局部上下文信息。通过利用现成掩码提议技术获得的实例掩码,我们的方法能够分割细粒度的实例级指称。我们还引入一种全局-局部文本编码器,其中全局特征捕获整个输入表达式的复杂句子级语义,而局部特征聚焦于由依存句法分析器提取的目标名词短语。在实验中,所提方法以显著优势优于该任务的若干零样本基线,甚至优于弱监督指称表达式分割方法。我们的代码可在 https://github.com/Seonghoon-Yu/Zero-shot-RIS 获取。

关键词

引用

@article{arxiv.2303.17811,
  title  = {Zero-shot Referring Image Segmentation with Global-Local Context Features},
  author = {Seonghoon Yu and Paul Hongsuck Seo and Jeany Son},
  journal= {arXiv preprint arXiv:2303.17811},
  year   = {2023}
}

备注

CVPR 2023