ViTALS:用于肾切除手术动作定位的Vision Transformer
计算机视觉与模式识别
2024-05-07 v1
摘要
手术动作定位是一项具有挑战性的计算机视觉问题。虽然其具有包括自动手术程序培训、手术工作流程优化等多个有前景的应用,但合适的模型设计对于完成此任务至关重要。此外,缺乏合适的医疗数据集增加了额外的复杂性。为此,本文引入了一个新的肾切除手术病例数据集,称为UroSlice。为从这些视频中进行动作定位,本文提出一种新颖模型,称为ViTALS(Vision Transformer for Action Localization in Surgical Nephrectomy)。该模型融合了层次化稀疏时间卷积层和跨层残差连接,以捕捉更细粒度和更粗粒度之间的时间相关性。该方法在Cholec80和UroSlice数据集上实现了最先进的性能(分别为89.8%和66.1%的准确率),验证了其有效性。
引用
@article{arxiv.2405.02571,
title = {ViTALS: Vision Transformer for Action Localization in Surgical Nephrectomy},
author = {Soumyadeep Chandra and Sayeed Shafayet Chowdhury and Courtney Yong and Chandru P. Sundaram and Kaushik Roy},
journal= {arXiv preprint arXiv:2405.02571},
year = {2024}
}
备注
Nephrectomy surgery, Surgical Phase Recognition, Surgical Workflow Segmentation, 11 pages, 2 figures, 2 tables