中文

SurroundOcc:面向自动驾驶的多相机三维占据预测

计算机视觉与模式识别 2023-08-29 v2

摘要

三维场景理解在基于视觉的自动驾驶中起着至关重要的作用。虽然现有方法大多聚焦于三维目标检测,但它们难以描述任意形状和无限类别的真实世界物体。为了实现对三维场景更全面的感知,本文提出一种 SurroundOcc 方法,利用多相机图像预测三维占据。我们首先提取每幅图像的多尺度特征,并采用空间 2D-3D 注意力将其提升到三维体空间。随后应用三维卷积逐步上采样体特征,并在多个层级施加监督。为获得稠密占据预测,我们设计了一条无需昂贵占据标注即可生成稠密占据真值的流程。具体而言,我们分别融合动态物体与静态场景的多帧 LiDAR 扫描,然后采用泊松重建(Poisson Reconstruction)填补孔洞并将网格体素化以获得稠密占据标签。在 nuScenes 和 SemanticKITTI 数据集上的大量实验证明了本方法的优越性。代码与数据集见 https://github.com/weiyithu/SurroundOcc

关键词

引用

@article{arxiv.2303.09551,
  title  = {SurroundOcc: Multi-Camera 3D Occupancy Prediction for Autonomous Driving},
  author = {Yi Wei and Linqing Zhao and Wenzhao Zheng and Zheng Zhu and Jie Zhou and Jiwen Lu},
  journal= {arXiv preprint arXiv:2303.09551},
  year   = {2023}
}

备注

Accepted to ICCV 2023. Code is available at https://github.com/weiyithu/SurroundOcc