中文

MVP-SEG:面向开放词汇语义分割的多视角提示学习

计算机视觉与模式识别 2023-04-17 v1

摘要

CLIP(对比语言-图像预训练)在开放词汇零样本图像级识别方面已发展成熟,但其在像素级任务中的应用较少被研究,其中多数工作直接采用CLIP特征而未加以审慎适配。在本工作中,我们首先论证了图像-像素级CLIP特征适配的必要性,随后提出多视角提示学习(MVP-SEG)作为一种有效方案,以实现图像-像素适配并解决开放词汇语义分割问题。具体而言,MVP-SEG通过我们的正交约束损失(OCLoss)刻意学习多个提示,使每个提示受监督以在不同物体部位上利用CLIP特征,且由所有提示协作生成的分割掩码促进了更好的分割。此外,MVP-SEG引入全局提示精炼(GPR)以进一步消除类间分割噪声。实验表明,从可见类别学到的多视角提示对不可见类别具有强泛化能力,且结合了知识迁移阶段的MVP-SEG+在多个基准上显著优于先前方法。此外,定性结果证明MVP-SEG确实能更好地聚焦于不同局部部位。

关键词

引用

@article{arxiv.2304.06957,
  title  = {MVP-SEG: Multi-View Prompt Learning for Open-Vocabulary Semantic Segmentation},
  author = {Jie Guo and Qimeng Wang and Yan Gao and Xiaolong Jiang and Xu Tang and Yao Hu and Baochang Zhang},
  journal= {arXiv preprint arXiv:2304.06957},
  year   = {2023}
}