中文

SAM2S:基于语义长期跟踪的外科视频分割

计算机视觉与模式识别 2025-11-21 v1 图像与视频处理 组织与器官

摘要

外科视频分割对于计算机辅助外科至关重要,使我们能够精确定位和跟踪器械和组织。基于提示的交互式视频对象分割(iVOS)模型,如分段Anything Model 2(SAM2),提供了超越具有预定义类别的方法的提示灵活性,但在外科场景中由于领域差距和有限的长期跟踪面临挑战。为解决这些限制,我们构建了SA-SV,最大的外科iVOS基准,包含实例级时空注释(masklets),涵盖八种手术类型(6.1万帧,1.6k masklets),实现了对长期跟踪和零样本泛化的全面开发和评估。基于SA-SV,我们提出SAM2S,一个为**S**urgical iVOS增强**S**AM2的基础模型,通过:(1)DiveMem,一种可训练的多样化记忆机制,用于稳健的长期跟踪;(2)语义时间学习用于仪器理解;以及(3)模糊性抗鲁棒学习以缓解跨多源数据集的注释不一致性。大量实验表明,在SA-SV上微调可显著提升性能,SAM2相对于基础SAM2提高了12.99的平均J\mathcal{J}\&F\mathcal{F}。SAM2S进一步将性能提升至80.42的平均J\mathcal{J}\&F\mathcal{F},超越基础和微调后的SAM2分别提升了17.10和4.11分,同时保持68 FPS的实时推理和强大的零样本泛化。代码和数据集将在https://jinlab-imvr.github.io/SAM2S发布。

关键词

引用

@article{arxiv.2511.16618,
  title  = {SAM2S: Segment Anything in Surgical Videos via Semantic Long-term Tracking},
  author = {Haofeng Liu and Ziyue Wang and Sudhanshu Mishra and Mingqi Gao and Guanyi Qin and Chang Han Low and Alex Y. W. Kong and Yueming Jin},
  journal= {arXiv preprint arXiv:2511.16618},
  year   = {2025}
}

备注

11 pages, 4 figures