中文

EgoExOR:用于手术活动理解的自我-外部中心手术室数据集

计算机视觉与模式识别 2025-06-02 v1

摘要

手术室要求外科医生、护士和设备在快节奏、遮挡严重的环境中进行精确协调,这需要先进的感知模型来提升安全性与效率。现有数据集要么提供部分自我中心视角,要么提供稀疏的外部中心多视角上下文,但未探索两者的全面结合。我们引入了 EgoExOR,这是首个融合第一人称与第三人称视角的手术室数据集及配套基准。EgoExOR 涵盖了两项模拟脊柱手术(超声引导下穿刺和微创脊柱手术)共 94 分钟(15 FPS 下 84,553 帧)的内容,集成了来自可穿戴眼镜的自我中心数据(RGB、注视点、手部追踪、音频)、来自 RGB-D 相机的外部中心 RGB 与深度数据,以及超声图像。其详细的场景图标注涵盖 36 个实体和 22 种关系(568,235 个三元组),支持动作识别和以人为中心的感知等任务,实现了对临床交互的稳健建模。我们评估了两个改编的 SOTA 模型的手术场景图生成性能,并提供了一个明确利用 EgoExOR 多模态与多视角信号的新基线。这一新数据集与基准为手术室感知奠定了新的基础,为下一代临床感知提供了丰富的多模态资源。

关键词

引用

@article{arxiv.2505.24287,
  title  = {EgoExOR: An Ego-Exo-Centric Operating Room Dataset for Surgical Activity Understanding},
  author = {Ege Özsoy and Arda Mamur and Felix Tristram and Chantal Pellegrini and Magdalena Wysocki and Benjamin Busam and Nassir Navab},
  journal= {arXiv preprint arXiv:2505.24287},
  year   = {2025}
}