基于伪激光雷达的深度相机位姿回归
计算机视觉与模式识别
2022-03-02 v1 机器学习
机器人学
摘要
一个准确且鲁棒的大规模定位系统是自动驾驶与增强现实等活跃研究领域的组成部分。为此,许多学习算法被提出,用于从 RGB 或 RGB-D 图像预测 6DOF 相机位姿。然而,以往融合深度的方法通常将深度数据当作 RGB 图像处理,常将深度图作为 RGB 图像的额外通道并输入卷积神经网络(CNNs)。本文表明,将深度图转换为伪激光雷达(pseudo-LiDAR)信号——此前已被证明对 3D 目标检测有用——是一种更优的相机定位任务表征,通过投影点云可准确确定 6DOF 相机位姿。我们首先比较了仅在伪激光雷达表征上运行的网络与仅在深度图上运行的网络的定位精度,从而证明这一点。随后我们提出 FusionLoc,一种利用伪激光雷达回归 6DOF 相机位姿的新颖架构。FusionLoc 是一个双流神经网络,旨在缓解在 RGB-D 图像上运行的典型 2D CNN 的常见问题。该架构的结果使用 7 Scenes 数据集与多种其他最先进(SOTA)深度位姿回归实现进行了比较。结果表明,FusionLoc 优于多种其他相机定位方法,平均而言比 RGB-D PoseNet 精确 0.33m 和 4.35{\deg}。通过证明在定位中使用伪激光雷达信号优于深度图,大规模定位系统的实现有了新的考量。
引用
@article{arxiv.2203.00080,
title = {Deep Camera Pose Regression Using Pseudo-LiDAR},
author = {Ali Raza and Lazar Lolic and Shahmir Akhter and Alfonso Dela Cruz and Michael Liut},
journal= {arXiv preprint arXiv:2203.00080},
year = {2022}
}
备注
7 pages, 5 figures, 2 tables