MoSFormer:通过手术记忆增强时间上下文以实现手术阶段识别
计算机视觉与模式识别
2025-03-04 v1
摘要
从视频中识别手术阶段可支持多种下游应用。基于Transformer的滑动窗口方法通过捕获丰富的时空特征已成为最先进方法。然而,尽管Transformer理论上可以处理任意长度的序列,但在实践中受限于内存和计算约束,导致固定上下文窗口难以在漫长手术过程中保持时间一致性。这常导致碎片化预测和有限的手术流程级理解。为应对这些挑战,我们提出了Memory of Surgery(MoS)框架,通过整合语义可解释的手术长期历史和短期印象来丰富时间建模。MoSFormer是我们增强的Transformer架构,通过精心设计的编码与融合机制集成MoS。我们进一步引入步骤过滤以精化历史表示,并开发了记忆缓存流水线以提升训练和推理稳定性,缓解捷径学习和过拟合。MoSFormer在多个基准上展示了最先进性能。在Challenging BernBypass70基准上,它达到88.0的视频级准确率和阶段级指标——精确度70.7、召回率68.7、F1分数66.3,超越基线(2.1的视频级准确率和阶段级指标——精确度4.6、召回率3.6、F1分数3.8)。进一步研究通过消融实验和反事实推理证实了长期和短期记忆组件各自及联合的优势。定性结果表明时间一致性得到改善。增强的时间上下文实现了手术流程级理解,为更全面的手术视频分析铺平了道路。
引用
@article{arxiv.2503.00695,
title = {MoSFormer: Augmenting Temporal Context with Memory of Surgery for Surgical Phase Recognition},
author = {Hao Ding and Xu Lian and Mathias Unberath},
journal= {arXiv preprint arXiv:2503.00695},
year = {2025}
}