SCOPE:面向手术场景分割的语音引导协同感知框架
计算机视觉与模式识别
2025-09-16 v1
摘要
对手术场景中相关元素进行精确分割与跟踪,对于实现上下文感知的术中辅助和决策至关重要。当前解决方案仍受限于依赖标注数据的特定领域监督模型,并且需要领域特定数据来适应新的手术场景和超出预定义标签类别的情况。基于提示的视觉基础模型(VFM)的最新进展已实现跨异构医学图像的开放集零样本分割。然而,这些模型对手动视觉或文本提示的依赖限制了它们在术中手术环境中的部署。我们提出了一种语音引导协同感知(SCOPE)框架,该框架将大语言模型(LLM)的推理能力与开放集 VFM 的感知能力相结合,以支持术中视频流中手术器械和解剖结构的即时分割、标记和跟踪。该框架的一个关键组件是协同感知智能体,它生成 VFM 分割的顶级候选结果,并融入临床医生的直观语音反馈,以自然的人机协同范式引导手术器械的分割。随后,器械本身作为交互式指针,用于标记手术场景中的其他元素。我们在公开可用的 Cataract1k 数据集的一个子集和一个内部的离体颅底数据集上评估了我们提出的框架,以展示其在手术场景中生成即时分割和跟踪的潜力。此外,我们通过一个模拟的离体实验展示了其动态能力。这种人机协同范式展示了为动态手术室环境开发适应性强、免提、以术者为中心的工具的潜力。
引用
@article{arxiv.2509.10748,
title = {SCOPE: Speech-guided COllaborative PErception Framework for Surgical Scene Segmentation},
author = {Jecia Z. Y. Mao and Francis X Creighton and Russell H Taylor and Manish Sahu},
journal= {arXiv preprint arXiv:2509.10748},
year = {2025}
}