中文

FreeSeg:基于可解释对比语言-图像预训练的自由掩码开放世界语义分割

计算机视觉与模式识别 2022-12-15 v2

摘要

全监督语义分割从稠密掩码中学习,这对于封闭集需要高昂的标注成本。在本文中,我们使用自然语言作为监督,无需任何像素级标注即可进行开放世界分割。我们将所提出的框架称为 FreeSeg,其中掩码可从预训练模型的原始特征图中自由获得。与零样本或开放集分割相比,FreeSeg 不需要任何标注掩码,并且广泛预测超出类不可知无监督分割的类别。具体而言,FreeSeg 从可解释对比语言-图像预训练(ICLIP)的图像-文本相似度图(ITSM)中获得自由掩码。我们的核心改进在于针对稠密 ICLIP 的平滑最小池化,以及用于分割的部分标签与像素策略。此外,FreeSeg 非常直接,无需分组、聚类或检索等复杂设计。除了简洁性之外,FreeSeg 的性能大幅超越先前最先进水平,例如在相同设置下 VOC 数据集上的 mIoU 高出 13.4%。

关键词

引用

@article{arxiv.2209.13558,
  title  = {FreeSeg: Free Mask from Interpretable Contrastive Language-Image Pretraining for Semantic Segmentation},
  author = {Yi Li and Huifeng Yao and Hualiang Wang and Xiaomeng Li},
  journal= {arXiv preprint arXiv:2209.13558},
  year   = {2022}
}

备注

This paper contains some immature results