CAT-Seg:面向开放词汇语义分割的代价聚合
计算机视觉与模式识别
2024-04-02 v2
摘要
开放词汇语义分割面临的挑战是,需要基于广泛的文本描述为图像中的每个像素赋予标签。在本工作中,我们引入了一种新颖的基于代价的方法,以适配视觉-语言基础模型(特别是 CLIP)来完成复杂的语义分割任务。通过聚合图像与文本嵌入之间的余弦相似度得分(即代价体),我们的方法通过微调 CLIP 的编码器,有效地使其适应于分割已见和未见类别,解决了现有方法在处理未见类别时面临的挑战。在此基础上,我们探索了有效聚合代价体的方法,考虑到其建立在图像与文本嵌入之间的多模态特性。此外,我们还研究了多种高效微调 CLIP 的方法。
引用
@article{arxiv.2303.11797,
title = {CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation},
author = {Seokju Cho and Heeseong Shin and Sunghwan Hong and Anurag Arnab and Paul Hongsuck Seo and Seungryong Kim},
journal= {arXiv preprint arXiv:2303.11797},
year = {2024}
}
备注
Accepted to CVPR 2024. Project page: https://ku-cvlab.github.io/CAT-Seg/