基于多帧上下文驱动的内窝手术工具焦点跟踪
计算机视觉与模式识别
2025-01-31 v1
摘要
自动化跟踪机器人手术视频中的外科工具焦点是诸多下游应用的关键任务,包括技能评估、专家评估和安全区域划定。近年来,深度学习在视觉应用中的爆发式发展导致了大量针对外科仪器分割的研究,而对跟踪特定工具焦点(如工具尖端)的关注相对较少。本文提出一种新型、基于多帧上下文的深度学习框架,用于定位和跟踪手术视频中的工具焦点。我们在 2015 年 EndoVis 挑战数据集上训练和测试了该模型,实现了 state-of-the-art 性能。通过利用先进的深度学习模型和多帧上下文,我们实现了 90% 的焦点检测准确率和 5.27 像素的定位 RMS 误差。针对自标注的 JIGSAWS 数据集中更具挑战性的情境,结果表明所提出的多帧模型能够准确跟踪工具焦点和工具基座焦点,整体 RMS 误差小于 4.2 像素。该框架为准确跟踪外科仪器焦点提供了可能,为进一步的下游应用铺平了道路。项目和数据集网页:https://tinyurl.com/mfc-tracker
引用
@article{arxiv.2501.18361,
title = {Video-based Surgical Tool-tip and Keypoint Tracking using Multi-frame Context-driven Deep Learning Models},
author = {Bhargav Ghanekar and Lianne R. Johnson and Jacob L. Laughlin and Marcia K. O'Malley and Ashok Veeraraghavan},
journal= {arXiv preprint arXiv:2501.18361},
year = {2025}
}