中文

GroundedSurg:面向语言条件手术器械分割的多程序基准

计算机视觉与模式识别 2026-03-03 v1

摘要

临床可靠的手术场景感知是推进智能、情境感知的内手术辅助系统(如器械交接指导、碰撞避免和工作流感知式机器人支持)的关键。现有手术器械基准主要评估类别级分割,要求模型检测预定义仪器类的所有实例。然而,真实临床决策往往需要基于其功能角色、空间关系或解剖相互作用能力来解析特定仪器实例,这些能力并未被当前评估范式所捕获。我们引入 GroundedSurg,首个语言条件、实例级手术 grounding 基准。每个实例将手术图像与针对单个仪器的自然语言描述配对,并附带结构化的空间 grounding 注释,包括边界框和点级锚点。该数据集涵盖眼科、腹腔、机器人和开放性手术程序,包含多样化的仪器类型、影像条件和手术复杂度。通过联合评估语言参考解析和像素级定位,GroundedSurg 实现了对临床情境下多仪器场景中视觉-语言模型的系统化且真实的评估。大量实验表明,现代分割方法和视觉-语言模型在本基准上表现存在显著差距,凸显了在手术 AI 系统中实现临床导向视觉-语言推理的紧迫需求。代码和数据已公开:https://github.com/gaash-lab/GroundedSurg

关键词

引用

@article{arxiv.2603.01108,
  title  = {GroundedSurg: A Multi-Procedure Benchmark for Language-Conditioned Surgical Tool Segmentation},
  author = {Tajamul Ashraf and Abrar Ul Riyaz and Wasif Tak and Tavaheed Tariq and Sonia Yadav and Moloud Abdar and Janibul Bashir},
  journal= {arXiv preprint arXiv:2603.01108},
  year   = {2026}
}

备注

https://github.com/gaash-lab/GroundedSurg