中文

CLIP作为RNN:无需训练即可分割无数视觉概念

计算机视觉与模式识别 2024-05-08 v3 计算与语言 机器学习 多媒体

摘要

现有的开放词汇图像分割方法需要在掩码标签和/或图像-文本数据集上进行微调步骤。掩码标签是劳动密集型的,这限制了分割数据集中类别的数量。因此,预训练VLM的词汇容量在微调后严重降低。然而,在没有微调的情况下,在弱图像-文本监督下训练的VLM往往会产生次优的掩码预测。为了缓解这些问题,我们引入了一种新颖的循环框架,该框架无需训练即可逐步过滤掉不相关的文本并提高掩码质量。循环单元是一个建立在冻结VLM上的两阶段分割器。因此,我们的模型保留了VLM的广泛词汇空间,并赋予其分割能力。实验表明,我们的方法不仅优于无训练的方法,也优于那些用数百万数据样本微调的方法,并在零样本语义分割和指代分割上创造了新的最先进记录。具体来说,我们在Pascal VOC、COCO Object和Pascal Context上分别将当前记录提高了28.8、16.0和6.9 mIoU。

关键词

引用

@article{arxiv.2312.07661,
  title  = {CLIP as RNN: Segment Countless Visual Concepts without Training Endeavor},
  author = {Shuyang Sun and Runjia Li and Philip Torr and Xiuye Gu and Siyang Li},
  journal= {arXiv preprint arXiv:2312.07661},
  year   = {2024}
}

备注

To appear in CVPR 2024. Project page: https://torrvision.com/clip_as_rnn/