基于可信长期跟踪的外科视频语义分割:ReSurgSAM2
计算机视觉与模式识别
2025-05-14 v1 图像与视频处理
组织与器官
摘要
外科场景分割是计算机辅助手术中至关重要的任务,有助于提高手术质量和患者预后。最近,指涉式手术分割正在兴起,由于其提供手术医生用于分割目标对象的交互式体验的优势。然而,现有方法受限于低效率和短期跟踪,阻碍其在复杂现实世界手术情境中的应用。本文引入ReSurgSAM2,一个两阶段的手术指涉分割框架,利用Segment Anything Model 2执行文本指涉目标检测,随后通过可靠的初始帧识别和多样性驱动的长期记忆进行跟踪。在检测阶段,我们提出一种跨模态时空Mamba,用于生成精确的检测和分割结果。基于这些结果,我们的可信初始帧选择策略识别后续跟踪的可靠帧。选定初始帧后,我们的方法转向跟踪阶段,集成一种多样性驱动的记忆机制,该机制维护可信且多样化的记忆库,确保一致的长期跟踪。广泛的实验表明,ReSurgSAM2在准确性和效率方面显著优于现有方法,实现实时61.2 FPS。我们的代码和数据集将在https://github.com/jinlab-imvr/ReSurgSAM2提供。
引用
@article{arxiv.2505.08581,
title = {ReSurgSAM2: Referring Segment Anything in Surgical Video via Credible Long-term Tracking},
author = {Haofeng Liu and Mingqi Gao and Xuxiao Luo and Ziyue Wang and Guanyi Qin and Junde Wu and Yueming Jin},
journal= {arXiv preprint arXiv:2505.08581},
year = {2025}
}
备注
Early accepted by MICCAI 2025