中文

基于免标定空间变换的鲁棒 3D 语义占据预测

计算机视觉与模式识别 2024-11-20 v1

摘要

3D 语义占据预测旨在提供对环境场景准确且全面的表示,对自动驾驶系统至关重要。对于配备多相机和 LiDAR 的自动驾驶汽车,将多传感器信息聚合到统一的 3D 空间以进行准确而鲁棒的预测至关重要。最近的方法主要建立在依赖传感器标定将 2D 图像信息投影到 3D 空间的 2D 到 3D 变换之上。然而,这些方法存在两个主要局限性:首先,它们依赖准确的传感器标定且对标定噪声敏感,这限制了其在真实复杂环境中的应用。其次,空间变换层计算成本高昂,限制了其在自动驾驶车辆上的运行。在这项工作中,我们尝试探索一种鲁棒且高效的 3D 语义占据(REO)预测方案。为此,我们提出了一种基于 vanilla attention 的免标定空间变换,以隐式建模空间对应关系。通过这种方式,我们在不使用传感器标定作为输入的情况下,鲁棒地将 2D 特征投影到预定义的 BEV 平面上。然后,我们引入 2D 和 3D 辅助训练任务,以增强 2D 主干网络在空间、语义和纹理特征上的判别能力。最后,我们提出了一种基于查询的预测方案,以高效生成大规模细粒度的占据预测。通过融合提供互补空间信息的点云,我们的 REO 在包括 OpenOccupancy、Occ3D-nuScenes 和 SemanticKITTI Scene Completion 在内的三个基准上大幅超越了现有方法。例如,与 Co-Occ 相比,我们的 REO 实现了 19.8×\times 的加速,并在 OpenOccupancy 上的几何 IoU 提升了 1.1。我们的代码将在 https://github.com/ICEORY/REO 上提供。

关键词

引用

@article{arxiv.2411.12177,
  title  = {Robust 3D Semantic Occupancy Prediction with Calibration-free Spatial Transformation},
  author = {Zhuangwei Zhuang and Ziyin Wang and Sitao Chen and Lizhao Liu and Hui Luo and Mingkui Tan},
  journal= {arXiv preprint arXiv:2411.12177},
  year   = {2024}
}

备注

13 pages, 11 figures, 18 tables