中文

基于Segment Anything Model 2的单目视频手术工具零样分割

图像与视频处理 2024-08-06 v1 计算机视觉与模式识别

摘要

Segment Anything Model 2(SAM 2)是最新一代图像和视频分割基础模型。它在扩大的Segment Anything Video(SA-V)数据集上进行训练,包含3550万个掩码和50900个视频。SAM 2通过各种提示(例如点、框和掩码)支持零样本分割,继承了其前任的能力。其强大的零样本性能和高效内存使用使其特别适合用于手术器械视频分割,尤其是由于标注数据稀缺以及手术程序多样性。在本研究中,我们评估了SAM 2在不同类型手术视频上的零样本视频分割性能,包括内窥镜和显微镜手术。我们还评估了其在单器械和多器械、长度各异的视频上的表现,以展示SAM 2在手术领域的适用性和有效性。我们发现:1)SAM 2在分割各种手术视频方面表现出色;2)当新工具进入场景时,需要额外的提示才能保持分割精度;3)手术视频固有的特定挑战可能影响SAM 2的鲁健性。

关键词

引用

@article{arxiv.2408.01648,
  title  = {Zero-Shot Surgical Tool Segmentation in Monocular Video Using Segment Anything Model 2},
  author = {Ange Lou and Yamin Li and Yike Zhang and Robert F. Labadie and Jack Noble},
  journal= {arXiv preprint arXiv:2408.01648},
  year   = {2024}
}

备注

The first work evaluates the performance of SAM 2 in surgical videos