TUNeS:一种用于基于视频的手术阶段识别的带自注意力时间 U-Net
计算机视觉与模式识别
2025-06-24 v6
摘要
目的:为使未来手术室中的上下文感知计算机辅助成为可能,认知系统需要自动理解医疗团队正在执行哪个手术阶段。手术阶段识别的主要信息来源通常是视频,其带来两个挑战:从视频流中提取有意义特征,以及有效建模视觉特征序列中的时间信息。方法:对于时间建模,注意力机制因其捕捉长程依赖的能力而流行。本文中,我们探索现有手术阶段识别时间模型中注意力的设计选择,并提出一种更新颖的方法,能更有效地使用注意力且不需要手工约束:TUNeS,一种高效简单的时间模型,在卷积 U-Net 结构核心融入自注意力。此外,我们提出将特征提取器(一个标准 CNN)与 LSTM 在优选长视频段即长时上下文上联合训练。结果:在我们的实验中,几乎所有时间模型在由更长时上下文训练的特征提取器上都表现更好。在这些上下文特征上,TUNeS 在 Cholec80 数据集上取得了 SOTA 结果。结论:本研究就如何使用注意力机制构建准确高效的运动阶段识别时间模型提供了新的见解。意义:实现自动手术阶段识别对于自动化分析和优化手术工作流,以及实现术中上下文感知计算机辅助至关重要,从而最终改善患者护理。
引用
@article{arxiv.2307.09997,
title = {TUNeS: A Temporal U-Net with Self-Attention for Video-based Surgical Phase Recognition},
author = {Isabel Funke and Dominik Rivoir and Stefanie Krell and Stefanie Speidel},
journal= {arXiv preprint arXiv:2307.09997},
year = {2025}
}
备注
Accepted for publication in IEEE Transactions on Biomedical Engineering