中文

CAT-Seg:面向开放词汇语义分割的代价聚合

计算机视觉与模式识别 2024-04-02 v2

摘要

开放词汇语义分割面临的挑战是,需要基于广泛的文本描述为图像中的每个像素赋予标签。在本工作中,我们引入了一种新颖的基于代价的方法,以适配视觉-语言基础模型(特别是 CLIP)来完成复杂的语义分割任务。通过聚合图像与文本嵌入之间的余弦相似度得分(即代价体),我们的方法通过微调 CLIP 的编码器,有效地使其适应于分割已见和未见类别,解决了现有方法在处理未见类别时面临的挑战。在此基础上,我们探索了有效聚合代价体的方法,考虑到其建立在图像与文本嵌入之间的多模态特性。此外,我们还研究了多种高效微调 CLIP 的方法。

关键词

引用

@article{arxiv.2303.11797,
  title  = {CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation},
  author = {Seokju Cho and Heeseong Shin and Sunghwan Hong and Anurag Arnab and Paul Hongsuck Seo and Seungryong Kim},
  journal= {arXiv preprint arXiv:2303.11797},
  year   = {2024}
}

备注

Accepted to CVPR 2024. Project page: https://ku-cvlab.github.io/CAT-Seg/