中文

DETR3D:基于 3D 到 2D 查询从多视角图像进行 3D 目标检测

计算机视觉与模式识别 2021-10-14 v1 人工智能 机器学习 机器人学

摘要

我们提出了一种多相机 3D 目标检测框架。与现有直接从单目图像估计 3D 边界框或使用深度预测网络从 2D 信息生成 3D 目标检测输入的工作不同,我们的方法直接在 3D 空间中操作预测。我们的架构从多个相机图像中提取 2D 特征,然后使用稀疏的一组 3D 目标查询来索引这些 2D 特征,利用相机变换矩阵将 3D 位置与多视角图像关联。最后,我们的模型对每个目标查询进行边界框预测,使用集合到集合损失来衡量真实值与预测之间的偏差。这种自顶向下方法优于自底向上方法(后者在逐像素深度估计之后进行目标边界框预测),因为它不受深度预测模型引入的复合误差影响。此外,我们的方法不需要非极大值抑制等后处理,显著提高了推理速度。我们在 nuScenes 自动驾驶基准上取得了最先进的性能。

关键词

引用

@article{arxiv.2110.06922,
  title  = {DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D Queries},
  author = {Yue Wang and Vitor Guizilini and Tianyuan Zhang and Yilun Wang and Hang Zhao and Justin Solomon},
  journal= {arXiv preprint arXiv:2110.06922},
  year   = {2021}
}

备注

Accepted to CORL 2021