MV-FCOS3D++:基于预训练单目骨干网络的多视角纯相机 4D 目标检测
计算机视觉与模式识别
2022-07-27 v1 机器人学
摘要
在本技术报告中,我们提出一种名为 MV-FCOS3D++ 的方案,用于 Waymo Open Dataset Challenge 2022 的纯相机 3D 检测赛道。对于多视角纯相机 3D 检测,基于鸟瞰图或 3D 几何表示的方法可利用相邻视角重叠区域的立体线索,并直接执行 3D 检测而无需手工后处理。然而,其缺乏针对 2D 骨干网络的直接语义监督,可通过预训练简单的基于单目的检测器来补充。我们的方案是遵循该范式用于 4D 检测的多视角框架。它构建于简单的单目检测器 FCOS3D++ 之上,仅使用 Waymo 的目标标注进行预训练,并将多视角特征转换至 3D 网格空间以在其中检测 3D 目标。设计了一种用于单帧理解与时序立体匹配的双路径颈结构以融入多帧信息。我们的方法最终以单一模型取得 49.75% 的 mAPL,并在 WOD 挑战赛中获第二名,训练期间无任何基于 LiDAR 的深度监督。代码将发布于 https://github.com/Tai-Wang/Depth-from-Motion。
引用
@article{arxiv.2207.12716,
title = {MV-FCOS3D++: Multi-View Camera-Only 4D Object Detection with Pretrained Monocular Backbones},
author = {Tai Wang and Qing Lian and Chenming Zhu and Xinge Zhu and Wenwei Zhang},
journal= {arXiv preprint arXiv:2207.12716},
year = {2022}
}
备注
Technical report