中文

基于 Segment Anything Model 2 的多分辨率和多光照条件下的提示式分割

计算机视觉与模式识别 2025-01-06 v4

摘要

本文就 Segment Anything Model (SAM) 及其更新版本 SAM 2 和 SAM 2.1,以及非提示式常规神经网络 (CNN),在分割太阳能板方面的零样本、提示式分割效果提供了见解。该研究在多样化的光照条件、空间分辨率和提示策略下对这些模型进行评估。SAM 2 在 SAM 方面略有改进,而 SAM 2.1 在亚优光照和低分辨率条件下显示出显著的改进。当使用用户定义的框提示时,SAM 模型在所有情形下均优于 CNN;特别是,用户框提示对于实现低分辨率数据中的合理性能至关重要。此外,在高分辨率下,YOLOv9 自动提示优于用户点提示,因其为 SAM 提供可靠的提示。在低分辨率下,由 YOLOv9 提供的提示下的 SAM 2.1 表现与由用户点提供的提示下的 SAM 2.1 相当,这突显了其零样本改进的优势——仅需一次点击即可实现。 在高分辨率且光照条件良好的图像中,Eff-UNet 在由 YOLOv9 提供的提示下优于 SAM;但在亚优光照条件下,Eff-UNet 与由 YOLOv9 提供的提示下的 SAM 2.1 表现相当。然而,SAM 计算资源更为密集,尽管 SAM 2.1 的推理时间有所改进,Eff-UNet 更适合用于高分辨率数据的自动分割。本研究详细阐述了每个模型的优势与局限性,概述了用户提示式图像分割模型的鲁棒性。

关键词

引用

@article{arxiv.2408.06970,
  title  = {Prompt-Based Segmentation at Multiple Resolutions and Lighting Conditions using Segment Anything Model 2},
  author = {Osher Rafaeli and Tal Svoray and Roni Blushtein-Livnon and Ariel Nahlieli},
  journal= {arXiv preprint arXiv:2408.06970},
  year   = {2025}
}