将 SAM 转用于用户定义的语义感知分割
计算机视觉与模式识别
2025-09-04 v3
摘要
Segment Anything Model(SAM)擅长从输入提示中生成精确的物体掩码,但缺乏语义感知,无法将其生成的掩码与特定物体类别相关联。为了解决这一局限性,我们提出了 U-SAM,一个将语义感知引入 SAM 的新颖框架,使其能够为用户指定的物体类别生成目标掩码。仅以用户输入的物体类别名称为条件,U-SAM 即可为图像提供像素级语义标注,而无需测试数据分布中的任何带标签/无标签样本。我们的方法利用合成生成或网络爬取的图像来积累关于所需物体类别的语义信息。然后,我们学习 SAM 的掩码嵌入与物体类别标签之间的映射函数,有效地增强了 SAM 具备特定粒度的语义识别能力。因此,用户可以为他们请求的特定物体获取有意义且具有针对性的分割掩码,而非通用且无标签的掩码。我们在 PASCAL VOC 2012 和 MSCOCO-80 上评估了 U-SAM,与现有最先进方法相比,分别实现了 +17.95% 和 +5.20% 的显著 mIoU 提升。通过将 SAM 转换为语义感知的分割模型,U-SAM 为资源受限环境下的跨多样且未见领域提供了一种实用且灵活的像素级标注解决方案。
引用
@article{arxiv.2312.02420,
title = {Repurposing SAM for User-Defined Semantics Aware Segmentation},
author = {Rohit Kundu and Sudipta Paul and Arindam Dutta and Amit K. Roy-Chowdhury},
journal= {arXiv preprint arXiv:2312.02420},
year = {2025}
}