将 Segment Anything Model 提升至开放词汇学习
计算机视觉与模式识别
2025-02-14 v2
摘要
最近的 Segment Anything Model (SAM) 已成为一种新的范式级视觉基础模型,展现出强大的零样本泛化能力和灵活的提示。尽管 SAM 在各个领域找到了应用和适配,其主要局限性在于无法理解目标语义。在本文中,我们提出 Sambor,在一个端到端框架中将 SAM 与开放词汇目标检测器无缝集成。在保留 SAM 固有的所有卓越能力的同时,我们将其提升至能够根据人类输入(如类别名称或指代表达)检测任意目标。基于 SAM 图像编码器,我们引入了一个新颖的 SideFormer 模块,旨在获取善于感知目标的 SAM 特征,并注入全面的语义信息以进行识别。此外,我们设计了一个 Open-set RPN,利用 SAM 提议来辅助发现潜在目标。因此,Sambor 使开放词汇检测器能够同等关注定位和分类子任务的泛化。我们的方法在包括 COCO 和 LVIS 在内的基准测试中展现出卓越的零样本性能,证明其与以前的最先进方法相比极具竞争力。我们希望这项工作能成为赋予 SAM 识别多样目标类别并在视觉基础模型支持下推进开放词汇学习的一项有意义的尝试。
引用
@article{arxiv.2312.03628,
title = {Boosting Segment Anything Model Towards Open-Vocabulary Learning},
author = {Xumeng Han and Longhui Wei and Xuehui Yu and Zhiyang Dou and Xin He and Kuiran Wang and Yingfei Sun and Zhenjun Han and Qi Tian},
journal= {arXiv preprint arXiv:2312.03628},
year = {2025}
}
备注
Accepted by AAAI 2025