SAM 2 在机器人手术中的应用:手术视频分割鲁棒性与泛化性的实证评估
计算机视觉与模式识别
2024-08-09 v1 机器人学
图像与视频处理
摘要
最近的 Segment Anything Model (SAM) 2 在语义分割中展现出卓越的基础能力,其记忆机制和掩码解码器进一步解决了视频跟踪和物体遮挡的挑战,从而在图像和视频的交互式分割中取得了优异结果。基于我们之前的实证研究,我们进一步探索了 SAM 2 在机器人辅助手术中基于提示的零样本分割性能,及其对真实世界损坏的鲁棒性。对于静态图像,我们采用两种提示形式:单点和边界框,而对于视频序列,单点提示应用于初始帧。通过在 MICCAI EndoVis 2017 和 EndoVis 2018 基准上的广泛实验,SAM 2 在使用边界框提示时,在比较评估中优于最先进(SOTA)方法。点提示的结果也显示出对 SAM 能力的显著增强,接近甚至超越了现有的无提示 SOTA 方法。此外,SAM 2 展现出更快的推理速度,并且在面对各种图像损坏时性能下降更小。尽管在特定边缘或区域仍存在略微不理想的结果,但 SAM 2 对单点提示的鲁棒适应性凸显了其在有限提示需求的下游手术任务中的潜力。
引用
@article{arxiv.2408.04593,
title = {SAM 2 in Robotic Surgery: An Empirical Evaluation for Robustness and Generalization in Surgical Video Segmentation},
author = {Jieming Yu and An Wang and Wenzhen Dong and Mengya Xu and Mobarakol Islam and Jie Wang and Long Bai and Hongliang Ren},
journal= {arXiv preprint arXiv:2408.04593},
year = {2024}
}
备注
Empirical study. Previous work "SAM Meets Robotic Surgery" is accessible at: arXiv:2308.07156