BodySLAM:面向外科应用的通用单目视觉SLAM框架
计算机视觉与模式识别
2024-11-05 v2 人工智能
机器人学
摘要
内窥手术依赖二维视图,给外科医生的深度感知和器械操作带来挑战。虽然单目视觉同时定位与地图(MVSLAM)作为一种有前景的解决方案,但其在内窥程序中的实现面临显著挑战,由于硬件限制,如单目摄像头的使用以及 odometry 传感器的缺失。本研究提出了 BodySLAM,一种稳健的基于深度学习的 MVSLAM 方法,通过三个关键组件解决了这些挑战:CycleVO,一种新颖的无监督单目姿态估计模块;集成最先进的 Zoe 架构用于单目深度估计;以及创建连贯外科地图的 3D 重建模块。该方法在三个公开数据集(Hamlyn、EndoSLAM 和 SCARED)上进行了严格评估,涵盖腹腔镜、胃镜和结肠镜场景,并与四种最先进的方法进行了基准测试。结果表明,CycleVO 在姿态估计方法中表现具有竞争力且推理时间最短,同时保持了稳健的泛化能力;而 Zoe 在内窥场景下的深度估计显著优于现有算法。BodySLAM 在多样化内窥场景中的卓越性能表明其作为内窥应用可行 MVSLAM 解决方案的潜力。
引用
@article{arxiv.2408.03078,
title = {BodySLAM: A Generalized Monocular Visual SLAM Framework for Surgical Applications},
author = {G. Manni and C. Lauretti and F. Prata and R. Papalia and L. Zollo and P. Soda},
journal= {arXiv preprint arXiv:2408.03078},
year = {2024}
}
备注
16 pages, 7 figures