MonoGRNet:一种单目3D目标检测的通用框架
计算机视觉与模式识别
2021-04-20 v1
摘要
在真实3D空间中检测与定位物体,对场景理解至关重要,但仅给定单目图像时由于成像投影中的几何信息损失而尤为困难。我们提出MonoGRNet,通过在对观察到的2D投影和未观测深度维度上的几何推理,实现从单目图像的非模态3D目标检测。MonoGRNet将单目3D目标检测任务分解为四个子任务:2D目标检测、实例级深度估计、投影3D中心估计和局部角点回归。该任务分解显著简化了单目3D目标检测,使目标3D边界框能在单次前向传播中高效预测,无需使用物体提议、后处理或先前方法所采用的算力昂贵的像素级深度估计。此外,MonoGRNet灵活适配全监督与弱监督学习,提升了我们框架在多样设置中的可行性。实验在KITTI、Cityscapes和MS COCO数据集上进行,结果展示了我们的框架在不同场景下的良好性能。
引用
@article{arxiv.2104.08797,
title = {MonoGRNet: A General Framework for Monocular 3D Object Detection},
author = {Zengyi Qin and Jinglu Wang and Yan Lu},
journal= {arXiv preprint arXiv:2104.08797},
year = {2021}
}
备注
The IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)