利用点跟踪与分割一切模型增强视频中高效实时手术器械分割
计算机视觉与模式识别
2024-07-03 v2
摘要
分割一切模型(SAM)是一种强大的视觉基础模型,正在革新传统的分割范式。尽管如此,对每一帧进行提示的依赖以及高昂的计算成本限制了其在机器人辅助手术中的应用。诸如增强现实引导等应用需要极少的用户干预以及高效的推理才能在临床上使用。在本研究中,我们通过采用轻量级 SAM 变体来满足效率要求,并利用微调技术增强其在手术场景中的泛化能力,从而解决这些局限性。任意点跟踪(TAP)的最新进展在准确性和效率方面都显示出有希望的结果,尤其是在点被遮挡或离开视野时。受此进展启发,我们提出了一个新颖的框架,该框架将在线点跟踪器与一个为手术器械分割微调的轻量级 SAM 模型相结合。感兴趣区域内的稀疏点被跟踪,并用于在整个视频序列中提示 SAM,从而提供时序一致性。定量结果在 EndoVis 2015 数据集上超越了最先进的半监督视频对象分割方法 XMem,达到了 84.8 IoU 和 91.0 Dice。我们的方法在离体 UCL dVRK 和在体 CholecSeg8k 数据集上取得了与 XMem 和基于 Transformer 的全监督分割方法相当的有前景的性能。此外,所提出的方法在无标签的 STIR 数据集上展示了有前景的零样本泛化能力。在效率方面,我们分别在单块 GeForce RTX 4060/4090 GPU 上测试了我们的方法,实现了超过 25/90 FPS 的推理速度。代码可在以下链接获取:https://github.com/wuzijian1997/SIS-PT-SAM
引用
@article{arxiv.2403.08003,
title = {Augmenting Efficient Real-time Surgical Instrument Segmentation in Video with Point Tracking and Segment Anything},
author = {Zijian Wu and Adam Schmidt and Peter Kazanzides and Septimiu E. Salcudean},
journal= {arXiv preprint arXiv:2403.08003},
year = {2024}
}
备注
6 pages, 9 figures