中文

面向全息外科场景图谱的构建

计算机视觉与模式识别 2025-07-25 v2

摘要

外科场景理解是计算机辅助干预系统的关键任务,需要对包含手术工具、解剖结构及其相互作用等多样要素的外科场景进行视觉理解。为有效表示外科场景中的复杂信息,图结构方法已探索用于结构化建模外科实体及其关系。虽然已证明使用图表示外科场景的可行性,但诸多外科场景方面——如工具-动作-目标的多样组合以及操作工具的手部身份——在图基表示中仍未被充分探索,尽管这些因素至关重要。为将这些要素纳入图表示,我们提出 Endoscapes-SG201 数据集,包含工具-动作-目标组合及手部身份标注。我们还引入 SSG-Com,一种图基方法,用于学习和表示这些关键场景图组件。通过在临床安全视图评估和动作三元组识别等下游任务上的实验,我们证明了整合这些必需场景图组件的重要性,凸显其在外科场景理解中的显著贡献。代码与数据集已提供于 https://github.com/ailab-kyunghee/SSG-Com

关键词

引用

@article{arxiv.2507.15541,
  title  = {Towards Holistic Surgical Scene Graph},
  author = {Jongmin Shin and Enki Cho and Ka Young Kim and Jung Yong Kim and Seong Tae Kim and Namkee Oh},
  journal= {arXiv preprint arXiv:2507.15541},
  year   = {2025}
}

备注

Accepted to MICCAI 2025