中文

Segment Anything模型在非可见光谱图像中应用的可变提示性能评估

计算机视觉与模式识别 2024-04-19 v1

摘要

Segment Anything Model (SAM) 是一种深度神经网络基础模型,旨在执行实例分割,因其零样本分割能力而广受欢迎。SAM通过基于各种输入提示(如文本、边界框、点或掩码)生成掩码,引入了一种新颖的方法来克服数据集特定稀缺性带来的限制。尽管SAM在包含约1100万张图像的大型数据集上训练,但其中大部分是自然摄影图像,来自其他模态的图像非常有限。虽然基于深度学习的视觉红外监控和X射线安检成像技术的快速发展显著提高了高精度检测、分类和分割物体的能力,但SAM的零样本能力是否能迁移到这些模态尚不清楚。本文评估了SAM在X射线/红外模态中分割感兴趣物体的能力。我们的方法使用预训练的SAM,并采用三种不同的提示:边界框、质心和随机点。我们提供了定量/定性结果以展示在选定数据集上的性能。我们的结果表明,当给定框提示时,SAM可以分割X射线模态中的物体,但对于点提示,其性能有所变化。具体来说,SAM在分割细长物体和有机材料(如塑料瓶)时表现不佳。我们发现,由于红外模态的低对比度特性,使用点提示分割红外物体也具有挑战性。本研究表明,虽然SAM在框提示下表现出出色的零样本能力,但在点提示下其性能从中等到较差不等,这表明在考虑将SAM用于X射线/红外图像时,需要特别关注其跨模态泛化能力。

关键词

引用

@article{arxiv.2404.12285,
  title  = {Performance Evaluation of Segment Anything Model with Variational Prompting for Application to Non-Visible Spectrum Imagery},
  author = {Yona Falinie A. Gaus and Neelanjan Bhowmik and Brian K. S. Isaac-Medina and Toby P. Breckon},
  journal= {arXiv preprint arXiv:2404.12285},
  year   = {2024}
}