UniSurgSAM:用于可靠外科视频分割的统一可提示模型
图像与视频处理
2026-04-07 v1 计算机视觉与模式识别
摘要
外科视频分割是计算机辅助手术的基础。在实际应用中,外科医生需要通过多样化的线索(如视觉选择、文本表达式或音频指令)在持续的手术程序中动态指定目标。然而,现有的可提示视频对象分割 (PVOS) 方法通常仅限于单一提示模式,依赖耦合框架导致目标初始化和跟踪之间的优化干扰。此外,这些方法在目标缺失时会产生幻觉预测,且在无故障恢复情况下容易积累掩码漂移。为解决这些挑战,我们提出了 UniSurgSAM,一种通过视觉、文本或音频提示实现可靠外科视频分割的统一 PVOS 模型。具体而言,UniSurgSAM 采用解耦的两阶段框架,独立优化初始化和跟踪,以解决优化干扰。在此框架中,我们引入了三项关键设计以确保可靠性:基于存在性的解码器通过建模目标缺失来抑制幻觉;基于边界的长期跟踪防止在延长序列中的掩码漂移;以及自适应状态转换在阶段之间建立反馈循环以实现故障恢复。此外,我们构建了一个来自四个公开外科数据集的多模式、多粒度基准,包含精确的实例级掩码块。大量实验表明,UniSurgSAM 在所有提示模式和粒度上实现了实时状态的性能,为计算机辅助手术提供了实用的基础。代码和数据集将在 https://jinlab-imvr.github.io/UniSurgSAM 提供。
引用
@article{arxiv.2604.03645,
title = {UniSurgSAM: A Unified Promptable Model for Reliable Surgical Video Segmentation},
author = {Haofeng Liu and Ziyue Wang and Alex Y. W. Kong and Guanyi Qin and Yunqiu Xu and Chang Han Low and Mingqi Gao and Lap Yan Lennon Chan and Yueming Jin},
journal= {arXiv preprint arXiv:2604.03645},
year = {2026}
}
备注
Extended version of MICCAI 2025 paper (ReSurgSAM2). 13 pages, 8 figures, 8 tables