基于卷积神经网络的多模态深度估计
计算机视觉与模式识别
2020-12-18 v1 人工智能
摘要
本文解决了在恶劣天气条件下,从稀疏距离传感器数据和单目相机图像进行稠密深度预测的问题。本工作通过应用深度学习方法,探讨了相机、雷达(Radar)和激光雷达(Lidar)等不同传感器模态对于深度估计的重要性。尽管激光雷达比雷达具有更高的深度感知能力,且在以往大量工作中已与相机图像融合,但利用卷积神经网络(CNN)对鲁棒的雷达距离数据与相机图像进行融合以估计深度的研究尚不多见。本工作提出了一种深度回归网络,采用迁移学习方法,其编码器使用高性能预训练模型进行初始化以提取稠密特征,解码器用于上采样并预测所需深度。结果在 Nuscenes、KITTI 以及一个使用 CARLA 模拟器生成的合成数据集上进行了展示。此外,还评估了在建筑工地从起重机上拍摄的俯视变焦相机图像,用于估计载重物起重机臂距地面的距离,以展示其在安全关键应用中的可用性。
引用
@article{arxiv.2012.09667,
title = {Multi-Modal Depth Estimation Using Convolutional Neural Networks},
author = {Sadique Adnan Siddiqui and Axel Vierling and Karsten Berns},
journal= {arXiv preprint arXiv:2012.09667},
year = {2020}
}
备注
submitted to IEEE International Symposium on Safety, Security, and Rescue Robotics (SSRR)