MM-OR:面向高强度手术环境语义理解的大规模多模态手术室数据集
计算机视觉与模式识别
2025-03-05 v1
摘要
手术室(OR)是复杂的高风险环境,需要精确理解医务人员、工具和设备之间的交互,以增强手术辅助、态势感知和患者安全。当前数据集在规模和真实性方面存在不足,且未能捕捉 OR 场景的多模态特性,限制了 OR 建模的进展。为此,我们引入了 MM-OR,一个逼真的大规模多模态时空 OR 数据集,也是首个支持多模态场景图生成的数据集。MM-OR 捕获了包含 RGB-D 数据、细节视图、音频、语音转录、机器人日志和跟踪数据的综合 OR 场景,并标注有全景分割、语义场景图和下游任务标签。此外,我们提出了 MM2SG,首个用于场景图生成的多模态大视觉语言模型,并通过大量实验证明了其有效利用多模态输入的能力。MM-OR 和 MM2SG 共同为整体 OR 理解建立了新的基准,并为复杂高风险环境中的多模态场景分析开辟了道路。我们的代码和数据可在 https://github.com/egeozsoy/MM-OR 获取。
引用
@article{arxiv.2503.02579,
title = {MM-OR: A Large Multimodal Operating Room Dataset for Semantic Understanding of High-Intensity Surgical Environments},
author = {Ege Özsoy and Chantal Pellegrini and Tobias Czempiel and Felix Tristram and Kun Yuan and David Bani-Harouni and Ulrich Eck and Benjamin Busam and Matthias Keicher and Nassir Navab},
journal= {arXiv preprint arXiv:2503.02579},
year = {2025}
}