SAM2S:基于语义长期跟踪的外科视频分割
计算机视觉与模式识别
2025-11-21 v1 图像与视频处理
组织与器官
摘要
外科视频分割对于计算机辅助外科至关重要,使我们能够精确定位和跟踪器械和组织。基于提示的交互式视频对象分割(iVOS)模型,如分段Anything Model 2(SAM2),提供了超越具有预定义类别的方法的提示灵活性,但在外科场景中由于领域差距和有限的长期跟踪面临挑战。为解决这些限制,我们构建了SA-SV,最大的外科iVOS基准,包含实例级时空注释(masklets),涵盖八种手术类型(6.1万帧,1.6k masklets),实现了对长期跟踪和零样本泛化的全面开发和评估。基于SA-SV,我们提出SAM2S,一个为**S**urgical iVOS增强**S**AM2的基础模型,通过:(1)DiveMem,一种可训练的多样化记忆机制,用于稳健的长期跟踪;(2)语义时间学习用于仪器理解;以及(3)模糊性抗鲁棒学习以缓解跨多源数据集的注释不一致性。大量实验表明,在SA-SV上微调可显著提升性能,SAM2相对于基础SAM2提高了12.99的平均\&。SAM2S进一步将性能提升至80.42的平均\&,超越基础和微调后的SAM2分别提升了17.10和4.11分,同时保持68 FPS的实时推理和强大的零样本泛化。代码和数据集将在https://jinlab-imvr.github.io/SAM2S发布。
引用
@article{arxiv.2511.16618,
title = {SAM2S: Segment Anything in Surgical Videos via Semantic Long-term Tracking},
author = {Haofeng Liu and Ziyue Wang and Sudhanshu Mishra and Mingqi Gao and Guanyi Qin and Chang Han Low and Alex Y. W. Kong and Yueming Jin},
journal= {arXiv preprint arXiv:2511.16618},
year = {2025}
}
备注
11 pages, 4 figures