中文

LoViT:用于手术阶段识别的长视频Transformer

计算机视觉与模式识别 2025-06-06 v3 人工智能

摘要

在线手术阶段识别在构建能够量化性能并监督手术工作流执行的上下文工具方面发挥着重要作用。现有方法存在局限:它们使用帧级监督训练空间特征提取器,可能因相似帧出现在不同阶段而导致错误预测;且由于计算限制难以充分融合局部与全局特征,这会影响对手术干预中常见的长视频的分析。本文提出一种两阶段方法,称为长视频Transformer(LoViT),用于融合短期与长期时间信息,其结合了一个时间信息丰富的空间特征提取器和一个多尺度时间聚合器,该聚合器由基于自注意力的两个级联L-Trans模块以及基于ProbSparse自注意力的G-Informer模块(用于处理全局时间信息)组成。随后,多尺度时间头融合局部与全局特征,并利用阶段转换感知监督对手术阶段进行分类。我们的方法在Cholec80和AutoLaparo数据集上持续优于当前最优(SOTA)方法。与Trans-SVNet相比,LoViT在Cholec80上的视频级准确率提升2.4 pp(百分点),在AutoLaparo上提升3.1 pp。此外,其在AutoLaparo上的阶段级Jaccard提升5.3 pp,在Cholec80上提升1.55 pp。我们的结果表明,该方法在不同手术过程和时间序列特征的两个数据集上实现了手术阶段识别的SOTA性能,同时引入了应对长视频的机制。

关键词

引用

@article{arxiv.2305.08989,
  title  = {LoViT: Long Video Transformer for Surgical Phase Recognition},
  author = {Yang Liu and Maxence Boels and Luis C. Garcia-Peraza-Herrera and Tom Vercauteren and Prokar Dasgupta and Alejandro Granados and Sebastien Ourselin},
  journal= {arXiv preprint arXiv:2305.08989},
  year   = {2025}
}

备注

Code link: https://github.com/MRUIL/LoViT