记忆增强的 SAM2:用于无训练外科视频分割的记忆增强模型
计算机视觉与模式识别
2025-07-23 v2
摘要
外科视频分割是计算机辅助手术中的关键任务,对于提高手术质量和患者预后至关重要。最近,Segment Anything Model 2 (SAM2) 框架在图像和视频分割方面取得了显著进展。然而,SAM2 的贪婪选择记忆设计在局限性被放大,由于外科视频的独特属性——快速仪器运动、频繁遮挡以及复杂仪器-组织相互作用——导致在复杂长视频分割性能下降。为解决这些挑战,我们引入 Memory Augmented (MA)-SAM2,一种无训练的视频对象分割策略, featuring novel context-aware and occlusion-resilient memory models。MA-SAM2 在面对复杂仪器运动导致的遮挡和相互作用时表现出强大的鲁棒性,同时保持在视频全程对对象分割的准确性。通过采用 multi-target, single-loop, one-prompt inference,进一步提高了多仪器视频中跟踪过程的效率。在不引入任何额外参数或 requiring further training 的情况下,MA-SAM2 在 EndoVis2017 和 EndoVis2018 数据集上分别实现了 4.36% 和 6.1% 的性能提升,展示了其在实际外科应用中的潜力。
引用
@article{arxiv.2507.09577,
title = {Memory-Augmented SAM2 for Training-Free Surgical Video Segmentation},
author = {Ming Yin and Fu Wang and Xujiong Ye and Yanda Meng and Zeyu Fu},
journal= {arXiv preprint arXiv:2507.09577},
year = {2025}
}
备注
Accepted in MICCAI 2025