中文

面向图像和视频分割的 SAM2:全面综述

计算机视觉与模式识别 2025-03-18 v1 人工智能

摘要

尽管深度学习在图像和视频分割方面取得了显著进展,但现有模型仍面临跨域适应性和泛化性方面的挑战。图像和视频分割是计算机视觉中的基础任务,广泛应用于医疗保健、农业、工业检查和自动驾驶等领域。随着大规模基础模型的出现,SAM2——即改进版的 SAM(Segment Anything Model)——针对分割任务进行了优化,在复杂场景中展现出增强的性能。然而,SAM2 在特定领域的可适应性和局限性仍需进一步调查。本文系统地分析了 SAM2 在图像和视频分割中的应用,并评估其在 various 领域的性能。我们首先介绍图像分割的基本概念,对基础模型进行分类,并探讨 SAM 和 SAM2 的技术特征。随后,本文深入探讨 SAM2 在静态图像和视频分割中的应用,重点强调其在医学成像等专门领域的性能以及跨域适应性挑战。作为本研究的一部分,我们审阅了超过 200 篇相关论文,以提供全面的分析。最后,本文指出了 SAM2 在分割任务中的优势与不足,识别其面临的技术挑战,并提出未来发展方向。本综述为优化和应用 SAM2 在现实场景中提供了宝贵的见解和实用建议。

关键词

引用

@article{arxiv.2503.12781,
  title  = {SAM2 for Image and Video Segmentation: A Comprehensive Survey},
  author = {Zhang Jiaxing and Tang Hao},
  journal= {arXiv preprint arXiv:2503.12781},
  year   = {2025}
}

备注

20 pages, 4 figures, 7 Tables