不存在 SAM 语义!探索 SAM 作为视觉理解任务的 Backbone
计算机视觉与模式识别
2024-11-26 v1
摘要
Segment Anything Model (SAM) 最初设计用于无标签掩码生成。该模型是否也具备内在的语义理解,对于更广泛的视觉任务具有价值?本文采用多阶段方法探索这一问题。我们首先通过将基准图像编码器在分类任务中的效能与 established 模型(CLIP 和 DINOv2)进行比较来量化 SAM 的语义能力。我们的发现揭示了 SAM 特征表示在语义可区分性方面的显著不足,限制了需要类区分的任务的潜在能力。这一初始结果激发了我们尝试通过轻量微调进行情境学习以获取语义信息的探索性研究,其中我们观察到对未见类别的通用性仍有限。我们的观察最终导致我们提出一种无训练方法,利用 DINOv2 特征,更好地为 SAM 赋予语义理解能力,通过基于特征的相似性实现实例级类区分。我们的研究表明,融合外部语义来源为增强 SAM 在需要语义理解的复杂视觉任务中的实用性提供了有前景的方向。
引用
@article{arxiv.2411.15288,
title = {There is no SAMantics! Exploring SAM as a Backbone for Visual Understanding Tasks},
author = {Miguel Espinosa and Chenhongyi Yang and Linus Ericsson and Steven McDonagh and Elliot J. Crowley},
journal= {arXiv preprint arXiv:2411.15288},
year = {2024}
}
备注
Preprint. Work in progress