中文

从 CLIP 中提取免费的密集标签

计算机视觉与模式识别 2022-07-28 v2 计算与语言

摘要

对比语言-图像预训练(CLIP)在开放词汇零样本图像识别中取得了显著突破。许多近期研究利用预训练的 CLIP 模型进行图像级分类与处理。本文中,我们希望考察 CLIP 在像素级密集预测(具体而言为语义分割)方面的内在潜力。为此,在极小改动下,我们展示了 MaskCLIP 在无标注和微调的情况下,于各数据集上对开放概念产生引人注目的分割结果。通过加入伪标注与自训练,MaskCLIP+ 大幅超越 SOTA 直推式零样本语义分割方法,例如 PASCAL VOC/PASCAL Context/COCO Stuff 上未见类的 mIoU 从 35.6/20.7/30.3 提升至 86.1/66.7/54.7。我们还测试了 MaskCLIP 在输入损坏下的鲁棒性,并评估其区分细粒度物体与新概念的能力。我们的发现表明,MaskCLIP 可作为密集预测任务实现无标注分割的新的可靠监督来源。源代码见 https://github.com/chongzhou96/MaskCLIP。

关键词

引用

@article{arxiv.2112.01071,
  title  = {Extract Free Dense Labels from CLIP},
  author = {Chong Zhou and Chen Change Loy and Bo Dai},
  journal= {arXiv preprint arXiv:2112.01071},
  year   = {2022}
}

备注

ECCV 2022 oral, project page: https://www.mmlab-ntu.com/project/maskclip/