中文

MonoGRNet:一种单目3D目标检测的通用框架

计算机视觉与模式识别 2021-04-20 v1

摘要

在真实3D空间中检测与定位物体,对场景理解至关重要,但仅给定单目图像时由于成像投影中的几何信息损失而尤为困难。我们提出MonoGRNet,通过在对观察到的2D投影和未观测深度维度上的几何推理,实现从单目图像的非模态3D目标检测。MonoGRNet将单目3D目标检测任务分解为四个子任务:2D目标检测、实例级深度估计、投影3D中心估计和局部角点回归。该任务分解显著简化了单目3D目标检测,使目标3D边界框能在单次前向传播中高效预测,无需使用物体提议、后处理或先前方法所采用的算力昂贵的像素级深度估计。此外,MonoGRNet灵活适配全监督与弱监督学习,提升了我们框架在多样设置中的可行性。实验在KITTI、Cityscapes和MS COCO数据集上进行,结果展示了我们的框架在不同场景下的良好性能。

关键词

引用

@article{arxiv.2104.08797,
  title  = {MonoGRNet: A General Framework for Monocular 3D Object Detection},
  author = {Zengyi Qin and Jinglu Wang and Yan Lu},
  journal= {arXiv preprint arXiv:2104.08797},
  year   = {2021}
}

备注

The IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)