SurgiSAM2:微调基础模型用于手术视频解剖分割与检测
计算机视觉与模式识别
2025-03-07 v1
摘要
背景:我们通过考察SAM 2在零样本场景和微调后的语义分割能力,评估其在手术场景理解中的表现。方法:我们利用五个公开数据集评估和微调SAM 2,用于分割手术视频/图像中的解剖组织。微调应用于图像编码器和掩码解码器。我们将每个类别的训练子集限制在50到400个样本之间,以更好地模拟数据获取中的真实约束。通过加权平均Dice系数(WMDC)评估数据集规模对微调性能的影响,并将结果与先前报道的最先进(SOTA)结果进行了比较。结果:微调后的SAM 2模型SurgiSAM 2在分割性能上取得了显著提升,与基线SAM 2相比相对WMDC增益达到17.9%。将提示点从1增加到10以及训练数据规模从每类50个增加到每类400个均提升了性能;在验证子集上,使用10个提示点和每类400个样本取得了最佳WMDC为0.92。在测试子集上,该模型在30个类别中的24个(80%)上优于先前的SOTA方法,使用10点提示时WMDC为0.91。值得注意的是,SurgiSAM 2能够有效泛化到未见过的器官类别,在其中7/9(77.8%)上取得了SOTA性能。结论:SAM 2在手术场景分割中取得了显著的零样本和微调性能,在多个数据集的多种器官类别上超越了先前的SOTA模型。这表明其在实现自动/半自动标注流程方面具有巨大潜力,从而减轻标注负担,促进多种手术应用。
引用
@article{arxiv.2503.03942,
title = {SurgiSAM2: Fine-tuning a foundational model for surgical video anatomy segmentation and detection},
author = {Devanish N. Kamtam and Joseph B. Shrager and Satya Deepya Malla and Xiaohan Wang and Nicole Lin and Juan J. Cardona and Serena Yeung-Levy and Clarence Hu},
journal= {arXiv preprint arXiv:2503.03942},
year = {2025}
}