MonoRUn:基于重建与不确定性传播的单目 3D 目标检测
计算机视觉与模式识别
2021-03-25 v2
摘要
3D 空间中的目标定位是单目 3D 目标检测中的挑战性环节。近期 6DoF 位姿估计的进展表明,预测图像与物体 3D 模型间的稠密 2D-3D 对应图、再通过 Perspective-n-Point(PnP)算法估计物体位姿,可取得卓越的定位精度。然而这些方法依赖以物体几何真值训练,而真实室外场景难以获取该真值。为解决此问题,我们提出 MonoRUn,一种以自监督方式学习稠密对应与几何、仅需简单 3D 边界框标注的新型检测框架。为回归像素相关的 3D 物体坐标,我们采用具不确定性感知的区域重建网络。对于自监督训练,预测的 3D 坐标被投影回图像平面。提出 Robust KL 损失以最小化不确定性加权的重投影误差。测试阶段,我们通过将所有下游模块传播网络不确定性来利用其不确定性。更具体地,采用不确定性驱动的 PnP 算法估计物体位姿及其协方差。大量实验表明,我们所提方法在 KITTI 基准上优于当前最先进方法。
引用
@article{arxiv.2103.12605,
title = {MonoRUn: Monocular 3D Object Detection by Reconstruction and Uncertainty Propagation},
author = {Hansheng Chen and Yuyao Huang and Wei Tian and Zhong Gao and Lu Xiong},
journal= {arXiv preprint arXiv:2103.12605},
year = {2021}
}
备注
CVPR 2021