DETR3D:基于 3D 到 2D 查询从多视角图像进行 3D 目标检测
计算机视觉与模式识别
2021-10-14 v1 人工智能
机器学习
机器人学
摘要
我们提出了一种多相机 3D 目标检测框架。与现有直接从单目图像估计 3D 边界框或使用深度预测网络从 2D 信息生成 3D 目标检测输入的工作不同,我们的方法直接在 3D 空间中操作预测。我们的架构从多个相机图像中提取 2D 特征,然后使用稀疏的一组 3D 目标查询来索引这些 2D 特征,利用相机变换矩阵将 3D 位置与多视角图像关联。最后,我们的模型对每个目标查询进行边界框预测,使用集合到集合损失来衡量真实值与预测之间的偏差。这种自顶向下方法优于自底向上方法(后者在逐像素深度估计之后进行目标边界框预测),因为它不受深度预测模型引入的复合误差影响。此外,我们的方法不需要非极大值抑制等后处理,显著提高了推理速度。我们在 nuScenes 自动驾驶基准上取得了最先进的性能。
引用
@article{arxiv.2110.06922,
title = {DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D Queries},
author = {Yue Wang and Vitor Guizilini and Tianyuan Zhang and Yilun Wang and Hang Zhao and Justin Solomon},
journal= {arXiv preprint arXiv:2110.06922},
year = {2021}
}
备注
Accepted to CORL 2021