手术室场景图生成中具有时间动态的三模态融合
计算机视觉与模式识别
2024-04-16 v1
摘要
全面理解手术场景有助于监控手术过程,减少事故发生率并提高医疗专业人员的工作效率。手术室内的语义建模作为场景图生成(SGG)任务具有挑战性,因为它涉及长时间内对细微手术动作的连续识别。为应对这一挑战,我们提出了一种三模态(即图像、点云和语言)融合与时间动态框架,称为TriTemp-OR。与以往通过记忆图整合时间信息的方法不同,我们的方法具有两个优势:1)我们直接利用视频流中的双模态时间信息进行层次化特征交互;2)嵌入来自大型语言模型(LLM)的先验知识以缓解手术室中的类别不平衡问题。具体而言,我们的模型在2D帧和3D点云之间执行时间交互,包括尺度自适应多视图时间交互(ViewTemp)和几何时间点聚合(PointTemp)。此外,我们迁移生物医学LLM LLaVA-Med的知识,以加深对术中关系的理解。所提出的TriTemp-OR通过关系感知统一聚合三模态特征来预测关系,从而生成场景图。在4D-OR基准上的实验结果表明,我们的模型在长期手术室流处理中具有优越性能。
引用
@article{arxiv.2404.09231,
title = {Tri-modal Confluence with Temporal Dynamics for Scene Graph Generation in Operating Rooms},
author = {Diandian Guo and Manxi Lin and Jialun Pei and He Tang and Yueming Jin and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2404.09231},
year = {2024}
}
备注
10 pages, 4 figures, 3 tables