SAM2 特征的通用性如何?
计算机视觉与模式识别
2025-10-21 v1
摘要
面向高效特征编码设计的通用型基础视觉模型与其专业化模型之间的权衡是关键问题,尚未得到充分理解。我们通过比较通用型Hiera 编码器与面向分割专业化的Segment Anything Model 2(SAM2)的特征多样性来探讨这一权衡。使用轻量级可训练颈部来探测其冻结特征的适应性,我们量化了专业化的资源论成本。我们的结果表明,尽管SAM2的专业化在深度估计等与空间相关的任务中非常有效,但其代价是较高的。对于姿态估计和图像描述等概念上遥远的任务,专业化的SAM2编码器未能匹配其通用主导者Hiera,表现出可衡量的更广义语义信息损失。对SAM2的新型跨颈部分析揭示了每个适应层均造成进一步的表征瓶颈。我们的分析阐明了特征通用性中的这些权衡,为在多样化下游应用中设计高效特征编码和适应策略提供了定量基础。
引用
@article{arxiv.2510.17051,
title = {How Universal Are SAM2 Features?},
author = {Masoud Khairi Atani and Alon Harell and Hyomin Choi and Runyu Yang and Fabien Racape and Ivan V. Bajic},
journal= {arXiv preprint arXiv:2510.17051},
year = {2025}
}
备注
This work has been accepted for publication in IEEE Picture Coding Symposium (PCS) 2025