面向单目三维目标检测的几何不确定性投影网络
计算机视觉与模式识别
2021-08-16 v2
摘要
几何投影是单目三维目标检测中一种强大的深度估计方法。它依赖于高度估计深度,从而将数学先验引入深度模型。但投影过程也引入了误差放大问题,即估计高度的误差会被放大并大幅反映在输出深度上。该特性导致不可控的深度推断,并损害训练效率。本文中,我们提出几何不确定性投影网络(GUP Net)以在推断和训练两个阶段解决误差放大问题。具体而言,提出GUP模块以获取推断深度的几何引导不确定性,其不仅为每个深度提供高可靠置信度,还有益于深度学习。此外,在训练阶段,我们提出分层任务学习策略以降低误差放大引起的不稳定性。该学习算法通过提出的指标监控各任务的学习状况,并根据其前置任务状况自适应分配不同任务的适当损失权重。基于此,各任务仅在其前置任务学习良好时才开始学习,可显著提升训练过程的稳定性与效率。大量实验证明了所提方法的有效性。整体模型能比现有方法推断更可靠的目标深度,并在KITTI基准上以车与行人类别的AP40超越最先进的基于图像的单体三维检测器3.74%和4.7%。
引用
@article{arxiv.2107.13774,
title = {Geometry Uncertainty Projection Network for Monocular 3D Object Detection},
author = {Yan Lu and Xinzhu Ma and Lei Yang and Tianzhu Zhang and Yating Liu and Qi Chu and Junjie Yan and Wanli Ouyang},
journal= {arXiv preprint arXiv:2107.13774},
year = {2021}
}
备注
To appear at ICCV2021