中文

GLSFormer:用于手术视频步骤识别的门控长短序列 Transformer

计算机视觉与模式识别 2023-07-22 v1 机器学习

摘要

自动化手术步骤识别是一项重要任务,可显著提升手术期间的患者安全性与决策能力。现有的手术步骤识别先进方法要么依赖于空间与时间信息的分离式多阶段建模,要么在联合学习时仅作用于短程时间分辨率。然而,联合建模时空特征与长程信息的优势未被考虑。本文中,我们提出一种基于视觉 Transformer 的方法,直接从帧级图像块序列联合学习时空特征。我们的方法融合了门控时间注意力机制,智能结合短期与长期时空特征表示。我们在两个白内障手术视频数据集(即 Cataract-101 与 D99)上广泛评估了我们的方法,并展示了相较于多种先进方法的优越性能。这些结果验证了我们所提方法对自动化手术步骤识别的适用性。我们的代码发布于:https://github.com/nisargshah1999/GLSFormer

关键词

引用

@article{arxiv.2307.11081,
  title  = {GLSFormer: Gated - Long, Short Sequence Transformer for Step Recognition in Surgical Videos},
  author = {Nisarg A. Shah and Shameema Sikder and S. Swaroop Vedula and Vishal M. Patel},
  journal= {arXiv preprint arXiv:2307.11081},
  year   = {2023}
}

备注

Accepted to MICCAI 2023 (Early Accept)