中文

使用混合Transformer进行腹腔镜妇科视频中的事件识别

计算机视觉与模式识别 2023-12-04 v1

摘要

分析腹腔镜手术视频是一项复杂且多方面的挑战,其应用包括手术训练、术中手术并发症预测和术后手术评估。在这些视频中识别关键事件是大多数此类应用的重要前提。在本文中,我们引入了一个专为腹腔镜妇科视频中相关事件识别定制的综合数据集。我们的数据集包含与主要术中挑战和术后并发症相关的关键事件的标注。为验证标注的精确性,我们使用若干CNN-RNN架构评估事件识别性能。此外,我们引入并评估了一种混合Transformer架构,结合定制的训练-推理框架,以识别腹腔镜手术视频中的四个特定事件。借助Transformer网络,我们提出的架构利用帧间依赖关系来抵消相关内容遮挡、运动模糊和手术场景变化的不利影响,从而显著提升事件识别准确率。而且,我们提出了一种帧采样策略,旨在应对手术场景和外科医生技能水平的变化,从而实现高时间分辨率的事件识别。我们通过一系列广泛实验,实证证明了相比传统CNN-RNN架构,我们所提方法在事件识别上的优越性。

关键词

引用

@article{arxiv.2312.00593,
  title  = {Event Recognition in Laparoscopic Gynecology Videos with Hybrid Transformers},
  author = {Sahar Nasirihaghighi and Negin Ghamsarian and Heinrich Husslein and Klaus Schoeffmann},
  journal= {arXiv preprint arXiv:2312.00593},
  year   = {2023}
}