中文

一种通过将视觉同步定位与建图(vSLAM)集成至 Mask R-CNN 的新型深度机器学习架构用于实时手术视频分析

图像与视频处理 2022-04-19 v3 计算机视觉与模式识别

摘要

每年有七百万人遭受手术并发症之苦,但若施以充分的手术训练与复盘,其中 50\% 可得预防。为提升手术表现,现有研究运用多种深度学习(DL)技术,包括卷积神经网络(CNN)与循环神经网络(RNN),以实现手术器械与工作流程检测的自动化。然而,精度仍有提升空间;且因 CNN 的复杂性,实时分析亦极为有限。本研究提出一种新型 DL 架构,将视觉同步定位与建图(vSLAM)集成至 Mask R-CNN。该架构 vSLAM-CNN(vCNN)首次集两者之长,包括(1)vSLAM 用于目标检测,聚焦几何信息以生成区域提议,与(2)CNN 用于目标识别,聚焦语义信息以进行图像分类,并将二者融入统一的端到端训练过程。该方法除视觉特征外还利用时空信息,在 M2CAI 2016 挑战赛数据集上评估,取得器械检测 96.8 mAP 与工作流程检测 97.5 平均 Jaccard 分数的最先进结果,超越以往所有工作,并达到 50 FPS 性能,较基于区域的 CNN 快 10 倍。区域提议模块(RPM)取代 Mask R-CNN 中的区域提议网络(RPN),精准放置边界框并降低标注需求。此外,开发了一款 Microsoft HoloLens 2 应用,以提供基于增强现实(AR)的手术训练与辅助方案。

关键词

引用

@article{arxiv.2103.16847,
  title  = {A Novel Deep ML Architecture by Integrating Visual Simultaneous Localization and Mapping (vSLAM) into Mask R-CNN for Real-time Surgical Video Analysis},
  author = {Ella Selina Lan},
  journal= {arXiv preprint arXiv:2103.16847},
  year   = {2022}
}

备注

Accepted and Published in ISBI 2022