中文

面向弱监督开放词汇语义分割的语言引导基准

计算机视觉与模式识别 2023-03-01 v1

摘要

越来越多的注意力正转向数据高效的问题设置,如开放词汇语义分割(OVSS),它处理的是对训练期间可能见过也可能没见过的任意物体进行分割。与 OVSS 相关的最接近的标准问题是零样本和少样本分割(ZSS, FSS)及其跨数据集变体,在这些变体中,需要从零到少量的标注来分割新类别。现有的 FSS 和 ZSS 方法利用全监督的像素级标注已见类别来分割未见类别。像素级标签难以获取,而使用廉价的图像级标签形式的弱监督通常更为实用。为此,我们提出了一种新颖的统一弱监督 OVSS 流水线,它能在归纳设置下对未见类别执行 ZSS、FSS 和跨数据集分割,而无需为基类(已见)或新类(未见)使用像素级标签。我们提出了弱监督语言引导分割网络(WLSegNet),这是一种新颖的语言引导分割流水线,它 i) 利用批量聚合(均值)学习可泛化的上下文向量,以使用冻结的 CLIP(一种视觉-语言模型)将类别提示映射到图像特征;ii) 将弱 ZSS/FSS 解耦为弱语义分割和零样本分割。所学的上下文向量避免了在训练期间对已见类别的过拟合,并在测试期间能更好地迁移到新类别。WLSegNet 避免了微调以及在训练期间使用外部数据集。所提出的流水线在 PASCAL VOC 上的弱广义零样本和弱少样本语义分割分别超越了现有方法 39 和 3 个 mIOU 点,在 MS COCO 上的弱少样本语义分割超越了 5 个 mIOU 点。在 2-way 1-shot 弱 FSS 这一更难的设置下,WLSegNet 在 PASCAL VOC 和 MS COCO 上分别以 13 和 22 个 mIOU 点超越了基线。

关键词

引用

@article{arxiv.2302.14163,
  title  = {A Language-Guided Benchmark for Weakly Supervised Open Vocabulary Semantic Segmentation},
  author = {Prashant Pandey and Mustafa Chasmai and Monish Natarajan and Brejesh Lall},
  journal= {arXiv preprint arXiv:2302.14163},
  year   = {2023}
}