中文

利用零分割标签的零引导分割

计算机视觉与模式识别 2023-09-06 v3

摘要

CLIP已实现了新颖且令人振奋的视觉-语言联合应用,其中之一是开放词汇分割,它能在给定任意文本查询时定位任意分割区域。在我们的研究中,我们探讨是否可能在无任何用户引导(如文本查询或预定义类别)的情况下发现语义分割区域,并自动用自然语言为其标注?我们提出了一种新颖的问题——零引导分割,以及首个基线方法,该方法利用两个预训练的通才模型DINO与CLIP,无需任何微调或分割数据集即可解决此问题。总体思路是先将图像分割为小的过分割块,将其编码进CLIP的视觉-语言空间,转化为文本标签,并将语义相似的分割块合并。然而,关键挑战在于如何将视觉分割块编码为平衡全局与局部上下文信息(二者均有助于识别)的块特定嵌入。我们的主要贡献是一种新颖的注意力掩码技术,通过分析CLIP内部的注意力层来平衡这两种上下文。我们还引入了若干用于评估这一新任务的指标。借助CLIP的固有知识,我们的方法能在博物馆人群中精确锁定蒙娜丽莎画作。项目页面:https://zero-guide-seg.github.io/。

关键词

引用

@article{arxiv.2303.13396,
  title  = {Zero-guidance Segmentation Using Zero Segment Labels},
  author = {Pitchaporn Rewatbowornwong and Nattanat Chatthee and Ekapol Chuangsuwanich and Supasorn Suwajanakorn},
  journal= {arXiv preprint arXiv:2303.13396},
  year   = {2023}
}