TSMS-SAM2:用于外科场景下可提示视频目标分割与跟踪的多尺度时序采样增强与记忆分裂剪枝
计算机视觉与模式识别
2025-08-11 v1
摘要
可提示视频目标分割和跟踪 (VOST) 由于出现了像 Segment Anything Model 2 (SAM2) 这样的基础模型,取得了显著进展;然而,其在外科视频分析中的应用仍面临复杂运动动力学和记忆冗余导致的学习效率问题。本文提出 TSMS-SAM2,一种新型框架,通过解决 SAM2 中快速物体运动和记忆冗余的挑战,增强了外科视频中可提示 VOST 的能力。TSMS-SAM2 引入两个关键策略:多时序尺度视频采样增强以提高对运动变异性的鲁棒性,以及记忆分裂与剪枝机制,对过去帧的特征进行组织和筛选,以实现更高效和更准确的分割。我们在 EndoVis2017 和 EndoVis2018 数据集上进行评估,TSMS-SAM2 实现了最高的平均 Dice 得分 95.24 和 86.73,优于先前的基于 SAM 方法和任务特定方法。广泛的消融研究确认了多尺度时序增强和记忆分裂的有效性,凸显了该框架在复杂外科场景中实现稳健、高效分割的潜力。我们的源代码将在 https://github.com/apple1986/TSMS-SAM2 上发布。
引用
@article{arxiv.2508.05829,
title = {TSMS-SAM2: Multi-scale Temporal Sampling Augmentation and Memory-Splitting Pruning for Promptable Video Object Segmentation and Tracking in Surgical Scenarios},
author = {Guoping Xu and Hua-Chieh Shao and You Zhang},
journal= {arXiv preprint arXiv:2508.05829},
year = {2025}
}
备注
23 pages, 5 figures