激励下一代分割模型时代:面向不同场景下的上下文依赖概念,对SAM和SAM 2进行全面评估
计算机视觉与模式识别
2025-08-27 v3
摘要
大规模基于数十亿图像-掩码对训练的基础模型覆盖广泛的场景、物体和上下文,SAM及其升级版SAM~2在计算机视觉领域产生了重大影响。凭借这种前所未有的数据多样性,它们展现出强大的开放世界分割能力,SAM~2进一步提升了这些能力以支持高质量视频分割。虽然SAMs在分割依赖上下文独立概念(如人物、汽车、道路)方面表现优异,但忽略了更具挑战性的上下文依赖(CD)概念,如视觉显著性、伪装、工业缺陷和医疗病灶。CD概念高度依赖全局和局部上下文信息,在不同上下文中容易受到变化的影响,这需要模型具备强大的判别能力。SAMs的全面评估不足限制了对其性能边界的理解,可能阻碍未来模型的设计。在本文中,我们在2D和3D图像和视频的各种视觉模态中,对SAMs在11个CD概念上进行彻底评估,涵盖自然、医疗和工业场景。我们开发了一个统一的评估框架支持SAM和SAM~2的手动、自动和中间自提示,同时借助特定的提示生成和交互策略。我们进一步探索了SAM~2进行情境学习的潜力,并引入提示鲁棒性测试以模拟真实世界的不完美提示。最后,我们分析了SAMs在理解CD概念方面的收益和局限性,并讨论了其在分割任务中的未来发展。
引用
@article{arxiv.2412.01240,
title = {Inspiring the Next Generation of Segment Anything Models: Comprehensively Evaluate SAM and SAM 2 with Diverse Prompts Towards Context-Dependent Concepts under Different Scenes},
author = {Xiaoqi Zhao and Youwei Pang and Shijie Chang and Yuan Zhao and Lihe Zhang and Chenyang Yu and Hanqi Liu and Jiaming Zuo and Jinsong Ouyang and Weisi Lin and Georges El Fakhri and Huchuan Lu and Xiaofeng Liu},
journal= {arXiv preprint arXiv:2412.01240},
year = {2025}
}
备注
Under submission to International Journal of Computer Vision (IJCV)