中文

在视觉 SLAM 中利用检测、跟踪与预测实现动态场景的实时语义建图

计算机视觉与模式识别 2022-10-11 v1

摘要

本文提出一种基于 ORB-SLAM2 的轻量级系统 RDS-SLAM,其仅使用一颗常见的 Intel Core i7 CPU,即可在动态场景下实时准确估计位姿并构建物体级语义地图。在 RDS-SLAM 中,我们提出了三项主要改进以及重大的架构修改,以克服 ORB-SLAM2 的局限。首先,它在关键帧中采用轻量级目标检测神经网络。其次,系统嵌入了一种高效的跟踪与预测机制,以去除所有输入帧中属于可移动物体的特征点。第三,通过检测与跟踪结果的概率融合构建语义八叉树地图,使机器人能够在动态场景中维持物体级的语义描述以支持潜在交互。我们在 TUM RGB-D 数据集上评估 RDS-SLAM,实验结果表明,RDS-SLAM 在动态场景下仅用 Intel Core i7 CPU 即可达到每帧 30.3 毫秒的运行速度,并与严重依赖 Intel Core i7 CPU 和强大 GPU 的先进 SLAM 系统取得相当的精度。

关键词

引用

@article{arxiv.2210.04562,
  title  = {Using Detection, Tracking and Prediction in Visual SLAM to Achieve Real-time Semantic Mapping of Dynamic Scenarios},
  author = {Xingyu Chen and Jianru Xue and Jianwu Fang and Yuxin Pan and Nanning Zheng},
  journal= {arXiv preprint arXiv:2210.04562},
  year   = {2022}
}