Segment Anything Model 2 在外科视频分割中的性能与非对抗鲁棒性
图像与视频处理
2024-08-19 v2
摘要
完全监督的深度学习 (DL) 模型用于外科视频分割已被证明在包括烟雾、出血和低照明等图像质量的非对抗性损坏方面表现不佳。面向图像分割的基础模型,如 segment anything model (SAM),该模型专注于基于交互提示的分割,远离语义类别,从而可以在更大且更多样化的数据上进行训练,这为具有适当用户提示的零样本泛化提供了显著优势。最近,基于这一成功,SAM-2 被提出进一步扩展从独立帧的交互式分割到视频分割的零样本交互式分割能力。在本文中,我们提出了首个评估 SAM-2 在外科视频数据上的绩效的实验研究。利用 SegSTRONG-C MICCAI EndoVIS 2024 子挑战数据集,我们评估了 SAM-2 在未受损坏内窥镜序列上的有效性,并在模拟烟雾、出血和低亮度条件下的各种提示策略下评估其非对抗鲁棒性。我们的实验表明,SAM-2 以零样本方式可以在外科视频数据上实现与完全监督的深度学习模型相当乃至更好的性能,包括在非对抗性图像质量损坏的情况下。此外,SAM-2 在所有条件下都 consistently 优于原始 SAM 及其医学变体。最后,帧稀疏提示在 SAM-2 上 consistently 优于逐帧提示,这表明允许 SAM-2 利用其时序建模能力导致更连贯且更准确的分割。
引用
@article{arxiv.2408.04098,
title = {Performance and Non-adversarial Robustness of the Segment Anything Model 2 in Surgical Video Segmentation},
author = {Yiqing Shen and Hao Ding and Xinyuan Shao and Mathias Unberath},
journal= {arXiv preprint arXiv:2408.04098},
year = {2024}
}