中文

Surgformer:基于分层时间注意力的外科变形器用于手术阶段识别

计算机视觉与模式识别 2024-08-08 v1

摘要

现有的手术阶段识别前沿方法要么依赖于在短时间分辨率下提取空间时间特征,要么采用在整个时间分辨率上依次提取空间和时间特征。然而,这些方法在建模空间时间依赖性和解决空间时间冗余问题方面存在局限性:1) 这些方法由于缺乏长程信息或联合空间时间建模,无法有效建模空间时间依赖性。2) 这些方法在整个时间分辨率上利用稠密空间特征,导致显著的空间时间冗余。为此,本文提出外科变形器(Surgformer),以端到端方式解决空间时间建模和冗余问题,采用分离的空间时间注意力机制,并以有限的稀疏帧为输入。此外,我们提出一种新型分层时间注意力(HTA),从以目标帧为中心的视角捕获不同时间分辨率下的全局和局部信息。与传统时间注意力主要强调稠密长程相似性不同,HTA不仅捕获长期信息,还考虑在信息帧之间的局部潜在一致性。HTA随后采用金字塔特征聚合,有效地利用不同时间分辨率下的时间信息,从而增强整体时间表征。大量实验在两个具有挑战性的基准数据集上验证,证明我们提出的Surgformer在与前沿方法方面表现优异。代码已发布于https://github.com/isyangshu/Surgformer。

关键词

引用

@article{arxiv.2408.03867,
  title  = {Surgformer: Surgical Transformer with Hierarchical Temporal Attention for Surgical Phase Recognition},
  author = {Shu Yang and Luyang Luo and Qiong Wang and Hao Chen},
  journal= {arXiv preprint arXiv:2408.03867},
  year   = {2024}
}