中文

学习辅助单目上下文有助于单目 3D 目标检测

计算机视觉与模式识别 2021-12-10 v1

摘要

单目 3D 目标检测旨在从输入的单张 2D 图像中定位 3D 边界框。这是一个极具挑战性且仍待解决的问题,尤其是在训练和/或推理中无法利用额外信息(例如深度、激光雷达和/或多帧)时。本文提出了一种简单而有效的单目 3D 目标检测方法,无需利用任何额外信息。它提出了 MonoCon 方法,该方法在训练中学习单目上下文作为辅助任务,以帮助单目 3D 目标检测。其关键思想是,利用图像中目标的标注 3D 边界框,在训练中存在一组丰富的、适定的投影 2D 监督信号,例如投影角关键点及其相对于 2D 边界框中心的关联偏移向量,这些应在训练中作为辅助任务加以利用。所提出的 MonoCon 在高层面上受到测度论中 Cramer-Wold 定理的启发。在实现上,它利用一个非常简单的端到端设计来证明学习辅助单目上下文的有效性,该设计由三个部分组成:一个基于深度神经网络(DNN)的特征主干,多个用于学习 3D 边界框预测所需基本参数的回归头分支,以及多个用于学习辅助上下文的回归头分支。训练后,辅助上下文回归分支被丢弃以获得更好的推理效率。在实验中,所提出的 MonoCon 在 KITTI 基准(汽车、行人和骑行者)上进行了测试。它在汽车类别上优于排行榜上所有先前的方法,并在行人和骑行者类别上获得了相当的准确度。得益于其简单的设计,所提出的 MonoCon 方法在比较中获得了最快的推理速度,达到 38.7 fps。

关键词

引用

@article{arxiv.2112.04628,
  title  = {Learning Auxiliary Monocular Contexts Helps Monocular 3D Object Detection},
  author = {Xianpeng Liu and Nan Xue and Tianfu Wu},
  journal= {arXiv preprint arXiv:2112.04628},
  year   = {2021}
}