LABRAD-OR:用于动态手术室中精确双模态推理的轻量记忆场景图
计算机视觉与模式识别
2023-03-24 v1
摘要
现代手术在复杂且动态的环境中进行,包括医务人员、患者与设备之间不断变化的相互作用。因此,对手术室(OR)的整体建模是一项具有挑战性但至关重要的任务,其有潜力优化手术团队的表现并助力开发改善患者结果的新手术技术。将手术场景整体表示为语义场景图(SGG),其中实体作为节点、它们之间的关系作为边,是实现细粒度语义 OR 理解的一个有前景的方向。我们首次提出利用时间信息以实现更准确和一致的整体 OR 建模。具体而言,我们引入记忆场景图,其中先前时间步的场景图作为引导当前预测的时间表示。我们设计了一个端到端架构,将轻量记忆场景图的时间信息与点云和图像的视觉信息智能融合。我们在 4D-OR 数据集上评估了我们的方法,并证明融入时间性带来了更准确和一致的结果,在宏 F1 上实现了 +5% 的提升并达到 0.88 的新 SOTA。本工作开辟了用记忆场景图表示整个手术历史的路径,并改进了 OR 中的整体理解。引入场景图作为记忆表示可为许多时间理解任务提供有价值的工具。
引用
@article{arxiv.2303.13293,
title = {LABRAD-OR: Lightweight Memory Scene Graphs for Accurate Bimodal Reasoning in Dynamic Operating Rooms},
author = {Ege Özsoy and Tobias Czempiel and Felix Holm and Chantal Pellegrini and Nassir Navab},
journal= {arXiv preprint arXiv:2303.13293},
year = {2023}
}
备注
11 pages, 3 figures