SegCLIP:基于可学习中心进行块聚合的开放词汇语义分割方法
计算机视觉与模式识别
2023-06-21 v2 人工智能
摘要
近年来,对比语言-图像预训练(如 CLIP)在各种下游任务上展现出了有前景的结果。该预训练模型通过从大规模文本-图像数据中学习,能够为图像捕捉丰富的视觉概念。然而,将学习到的视觉知识迁移到开放词汇语义分割仍鲜有探索。本文提出一种基于 CLIP 的模型 SegCLIP,以无标注方式处理开放词汇分割问题。SegCLIP 基于 ViT 实现分割,其主要思想是通过在文本-图像对上训练,利用可学习中心将图像块聚集到语义区域。该聚集操作能够动态捕捉语义组,并用于生成最终的分割结果。我们进一步提出针对掩码块的重建损失以及基于超像素的带伪标签的 KL 损失,以增强视觉表征。实验结果表明,与基线相比,我们的模型在 PASCAL VOC 2012(+0.3% mIoU)、PASCAL Context(+2.3% mIoU)和 COCO(+2.2% mIoU)上取得了相当或更优的分割精度。我们在 https://github.com/ArrowLuo/SegCLIP 发布了代码。
引用
@article{arxiv.2211.14813,
title = {SegCLIP: Patch Aggregation with Learnable Centers for Open-Vocabulary Semantic Segmentation},
author = {Huaishao Luo and Junwei Bao and Youzheng Wu and Xiaodong He and Tianrui Li},
journal= {arXiv preprint arXiv:2211.14813},
year = {2023}
}