OPA-3D:用于单目三维目标检测的遮挡感知逐像素聚合网络
计算机视觉与模式识别
2022-11-03 v1
摘要
尽管得益于使用预训练深度估计器恢复伪LiDAR,单目三维目标检测近期取得了显著进展,但此类两阶段方法通常存在过拟合问题,且无法显式刻画深度与目标边界框之间的几何关系。为克服这一局限,我们提出OPA-3D,一种单阶段、端到端的遮挡感知逐像素聚合(Occlusion-Aware Pixel-Wise Aggregation)网络,联合估计稠密场景深度、深度-边界框残差与目标边界框,从而实现三维目标的双流检测,显著提升检测鲁棒性。其中,称为几何流(Geometry Stream)的流结合可见深度与深度-边界框残差,通过显式遮挡感知优化恢复目标边界框。此外,采用基于边界框的几何投影方案以增强距离感知。第二流称为上下文流(Context Stream),直接回归三维目标位置与尺寸。这种新颖的双流表示进一步使我们能够施加跨流一致性约束以对齐两流输出,提升整体性能。在公开基准上的大量实验表明,OPA-3D在主要Car类别上优于当前最优方法,同时保持实时推理速度。我们计划很快发布所有代码与训练模型。
引用
@article{arxiv.2211.01142,
title = {OPA-3D: Occlusion-Aware Pixel-Wise Aggregation for Monocular 3D Object Detection},
author = {Yongzhi Su and Yan Di and Fabian Manhardt and Guangyao Zhai and Jason Rambach and Benjamin Busam and Didier Stricker and Federico Tombari},
journal= {arXiv preprint arXiv:2211.01142},
year = {2022}
}