MOTSLAM:基于单目深度估计的MOT辅助单目动态SLAM
计算机视觉与模式识别
2022-10-06 v1
摘要
面向静态场景的视觉SLAM系统已发展出令人满意的精度与鲁棒性。随着在自动驾驶、增强与虚拟现实等多种场景中理解动态周围环境的需求,动态3D物体跟踪已成为视觉SLAM的一项重要能力。然而,仅依靠单目图像执行动态SLAM仍是一个具有挑战性的问题,原因在于动态特征关联及其位置估计的困难。本文中,我们提出MOTSLAM,一种采用单目配置的动态视觉SLAM系统,可同时跟踪动态物体的位姿与边界框。MOTSLAM首先执行多目标跟踪(MOT),结合关联的2D与3D边界框检测以创建初始3D物体。随后,应用基于神经网络的单目深度估计来获取动态特征的深度。最后,使用一种新颖的束调整(bundle adjustment)联合优化相机位姿、物体位姿以及静态与动态地图点。我们在KITTI数据集上的实验表明,我们的系统在单目动态SLAM的相机自运动与物体跟踪上均达到了最佳性能。
引用
@article{arxiv.2210.02038,
title = {MOTSLAM: MOT-assisted monocular dynamic SLAM using single-view depth estimation},
author = {Hanwei Zhang and Hideaki Uchiyama and Shintaro Ono and Hiroshi Kawasaki},
journal= {arXiv preprint arXiv:2210.02038},
year = {2022}
}