中文

利用宽基线多视角交通摄像头数据进行单目3D目标检测器的弱监督训练

计算机视觉与模式识别 2022-11-30 v1

摘要

在交叉路口对车辆进行精确的7自由度(7DoF)预测是评估道路使用者之间潜在冲突的一项重要任务。原则上,这可以通过一个能够检测每辆车位姿的单摄像头系统来实现,但这需要一个大规模、精确标注的数据集来训练检测器。尽管存在大型车辆位姿数据集(表面上是为自动驾驶车辆开发的),我们发现在此类数据集上训练并不充分。这些数据集包含地面视角的图像,而用于交叉路口观测的理想视角应更高地架设于路面之上。我们开发了一种替代方法,采用弱监督方式微调用于交通观测摄像头的3D目标检测器;并在此过程中表明,现有的大型自动驾驶数据集可用于预训练。为微调单目3D目标检测器,我们的方法利用来自重叠宽基线视角的多个2D检测结果,以及一种编码潜在几何一致性的损失函数。我们的方法在我们的数据集上达到了与自动驾驶数据集上性能最优的单目3D目标检测器相当的车辆7DoF位姿预测精度。我们介绍了我们的训练方法、多视角重投影损失以及数据集。

关键词

引用

@article{arxiv.2110.10966,
  title  = {Weakly Supervised Training of Monocular 3D Object Detectors Using Wide Baseline Multi-view Traffic Camera Data},
  author = {Matthew Howe and Ian Reid and Jamie Mackenzie},
  journal= {arXiv preprint arXiv:2110.10966},
  year   = {2022}
}

备注

Paper accepted at The 32nd British Machine Vision Conference, BMVC 2021