无深度传感器的RGB-D SLAM
计算机视觉与模式识别
2025-11-04 v2 机器人学
摘要
我们提出DropD-SLAM,一个实时的单目SLAM系统,无需依赖深度传感器即可实现RGB-D水平的精度。该系统用三个预训练的视觉模块替换主动深度输入:单目度量深度估计器、学习型关键点检测器和实例分割网络。通过膨胀实例掩码抑制动态对象,而将静态关键点分配预测深度值并反投影到3D空间以形成度量比例的特征。这些特征由 unmodified 的RGB-D SLAM后端处理,用于跟踪和映射。在TUM RGB-D基准测试中,DropD-SLAM在静态序列上实现了7.4厘米的平均ATE,在动态序列上达到1.8厘米,匹配或超越了最先进的RGB-D方法,同时在单张GPU上以22 FPS的速度运行。这些结果表明,现代预训练视觉模型可以作为可靠、实时的度量比例来源,取代主动深度传感器,为更简单、更具成本效益的SLAM系统铺平了道路。
关键词
引用
@article{arxiv.2510.06216,
title = {Dropping the D: RGB-D SLAM Without the Depth Sensor},
author = {Mert Kiray and Alican Karaomer and Benjamin Busam},
journal= {arXiv preprint arXiv:2510.06216},
year = {2025}
}