中文

S^2Former-OR:用于手术室场景图生成的单阶段双模态Transformer

计算机视觉与模式识别 2024-08-08 v2

摘要

手术过程的场景图生成(SGG)对于增强手术室(OR)的整体认知智能至关重要。然而,以往的工作主要依赖于多阶段学习,其中生成的语义场景图依赖于姿态估计和物体检测的中间过程。这种流水线可能会损害学习多模态表示的灵活性,从而限制整体效果。在本研究中,我们提出了一种新颖的单阶段双模态Transformer框架,用于手术室中的SGG,称为S^2Former-OR,旨在以端到端的方式互补利用多视角2D场景和3D点云进行SGG。具体来说,我们的模型采用了视图同步输血方案以促进多视角视觉信息交互。同时,设计了几何-视觉凝聚操作,将协同的2D语义特征整合到3D点云特征中。此外,基于增强的特征,我们提出了一种新颖的关系敏感Transformer解码器,嵌入动态实体对查询和关系特征先验,从而能够直接预测实体对关系以生成图,无需中间步骤。大量实验验证了S^2Former-OR在4D-OR基准上相比当前OR-SGG方法具有更优的SGG性能和更低的计算成本,例如精确率提高3个百分点,模型参数减少24.2M。我们进一步将我们的方法与通用的单阶段SGG方法进行了更广泛指标的对比评估,始终取得了更好的性能。

关键词

引用

@article{arxiv.2402.14461,
  title  = {S^2Former-OR: Single-Stage Bi-Modal Transformer for Scene Graph Generation in OR},
  author = {Jialun Pei and Diandian Guo and Jingyang Zhang and Manxi Lin and Yueming Jin and Pheng-Ann Heng},
  journal= {arXiv preprint arXiv:2402.14461},
  year   = {2024}
}

备注

This work has been accepted by TMI2024