Open-Vocabulary Semantic Segmentation的有效SAM组合策略
计算机视觉与模式识别
2025-04-01 v2
摘要
开词表语义分割旨在为图像中的像素分配跨越广泛类别的标签。传统方法通过依次连接强大的掩码提议生成器(如 Segment Anything Model, SAM)与预训练的视觉语言模型(如 CLIP)来实现此目标。但这类两阶段方法常常 suffer from 高计算成本和内存低效。在本文中,我们提出了 ESC-Net,一种新型的单阶段开词表分割模型,利用 SAM 解码器块进行类无标签分割,并置于高效推理框架中。通过将由图像-文本相关性生成的伪提示嵌入 SAM 的可提示分割框架中,ESC-Net 实现了对精确掩码预测的细化空间聚合。ESC-Net 在标准基准测试(包括 ADE20K、PASCAL-VOC 和 PASCAL-Context)上取得优异性能,显著优于先前方法,两者在效率和准确性方面均表现出色。全面的消融研究进一步表明其在面对挑战性条件时的鲁棒性。
引用
@article{arxiv.2411.14723,
title = {Effective SAM Combination for Open-Vocabulary Semantic Segmentation},
author = {Minhyeok Lee and Suhwan Cho and Jungho Lee and Sunghun Yang and Heeseung Choi and Ig-Jae Kim and Sangyoun Lee},
journal= {arXiv preprint arXiv:2411.14723},
year = {2025}
}
备注
Accepted to CVPR 2025