中文

ASI-Seg:基于术者意图的音频驱动手术器械分割

计算机视觉与模式识别 2024-07-30 v1 人工智能 计算与语言 人机交互 机器人学

摘要

手术器械分割是手术场景理解中的关键环节,有助于提升手术安全性。现有算法直接检测输入图像中预定义类别的所有器械,缺乏根据术者意图对特定器械进行分割的能力。在手术的不同阶段,术者会表现出不同的偏好并关注不同的手术器械。因此,能够遵循术者意图的器械分割算法可以最大限地减少无关器械的干扰,对术者具有极大的帮助。最近的Segment Anything Model (SAM)显示出了遵循提示进行对象分割的能力,但手术期间的手动提示标注是不可行的。为解决操作室中的这些限制,我们提出了一个音频驱动的手术器械分割框架,称为ASI-Seg,通过解析术者的音频命令来准确分割所需的手术器械。具体而言,我们提出了一种意图导向的多模态融合方法,用于从音频命令中解释分割意图并检索相关器械细节以促进分割。此外,为引导ASI-Seg对所需手术器械的分割,我们设计了一种对比学习提示编码器,以有效区分所需器械与无关器械。因此,我们的ASI-Seg促进了操作室中的工作流程,为术者提供有针对性的支持并降低了认知负荷。进行了大量实验来验证ASI-Seg框架,结果在语义分割和意图导向分割方面均显示出比经典最先进方法和医学SAM的显著优势。源代码可在https://github.com/Zonmgin-Zhang/ASI-Seg查看。

关键词

引用

@article{arxiv.2407.19435,
  title  = {ASI-Seg: Audio-Driven Surgical Instrument Segmentation with Surgeon Intention Understanding},
  author = {Zhen Chen and Zongming Zhang and Wenwu Guo and Xingjian Luo and Long Bai and Jinlin Wu and Hongliang Ren and Hongbin Liu},
  journal= {arXiv preprint arXiv:2407.19435},
  year   = {2024}
}

备注

This work is accepted by IROS 2024 (Oral)