CLIP-DIY:CLIP 密集推理实现免训练的开放词汇语义分割
计算机视觉与模式识别
2023-11-29 v2
摘要
CLIP 的出现为开放世界图像感知开辟了道路。该模型的零样本分类能力令人印象深刻,但更难用于图像分割等密集任务。若干方法提出了不同修改与学习方案以产生密集输出。相反,我们在本工作中提出一种称为 CLIP-DIY 的开放词汇语义分割方法,其无需任何额外训练或标注,而是利用现有的无监督目标定位方法。具体而言,CLIP-DIY 是一种多尺度方法,直接在不同尺寸图像块上发挥 CLIP 分类能力,并将决策聚合为单一图。我们进一步使用无监督目标定位方法获得的前景/背景分数引导分割。借助我们的方法,在 PASCAL VOC 上取得最先进的零样本语义分割结果,并在 COCO 上与最优方法表现相当。代码见 http://github.com/wysoczanska/clip-diy
引用
@article{arxiv.2309.14289,
title = {CLIP-DIY: CLIP Dense Inference Yields Open-Vocabulary Semantic Segmentation For-Free},
author = {Monika Wysoczańska and Michaël Ramamonjisoa and Tomasz Trzciński and Oriane Siméoni},
journal= {arXiv preprint arXiv:2309.14289},
year = {2023}
}
备注
Accepted to WACV 2024