中文

用于多视角 3D 目标检测的视角等变性

计算机视觉与模式识别 2023-04-10 v2 人工智能 机器学习 机器人学

摘要

来自视觉传感器的 3D 目标检测是机器人系统的基石能力。最先进的方法侧重于从多视角相机输入推理和解码物体边界框。在本工作中,我们从多视角一致性在 3D 场景理解和几何学习中的重要作用获得直觉。为此,我们引入 VEDet,一种新颖的 3D 目标检测框架,利用 3D 多视角几何通过视角感知和等变性改善定位。VEDet 采用基于查询的 transformer 架构,并通过用其 3D 透视几何的位置编码增强图像特征来编码 3D 场景。我们在输出层设计视角条件查询,从而在训练期间生成多个虚拟帧,通过强制多视角一致性来学习视角等变性。在输入层作为位置编码注入并在损失层正则化的多视角几何为 3D 目标检测提供了丰富的几何线索,从而在 nuScenes 基准上取得最先进性能。代码和模型发布于 https://github.com/TRI-ML/VEDet。

关键词

引用

@article{arxiv.2303.14548,
  title  = {Viewpoint Equivariance for Multi-View 3D Object Detection},
  author = {Dian Chen and Jie Li and Vitor Guizilini and Rares Ambrus and Adrien Gaidon},
  journal= {arXiv preprint arXiv:2303.14548},
  year   = {2023}
}

备注

11 pages, 4 figures; accepted to CVPR 2023