中文

调节中间3D特征以服务于视觉中心自动驾驶

计算机视觉与模式识别 2023-12-20 v1

摘要

多相机感知任务在自动驾驶领域受到了广泛关注。然而,在多相机设置下,现有的基于 Lift-Splat-Shoot (LSS) 的框架由于其投影特性和不可控的致密化过程,无法产生合适的密集3D特征。为解决这一问题,我们提出借助体渲染来调节中间密集3D特征。具体而言,我们采用体渲染处理密集3D特征以获取相应的2D特征(如深度图、语义图),并在训练中由相关标签进行监督。这种方式在特征层面调节了密集3D特征的生成,为多种感知任务提供了适当的密集且统一的特征。因此,我们的方法被称为 Vampire,代表“Volume rendering As Multi-camera Perception Intermediate feature REgulator”(体渲染作为多相机感知中间特征调节器)。在 Occ3D 和 nuScenes 数据集上的实验结果表明,Vampire 促进了密集3D特征的细粒度且合适的提取,在 3D 占用预测、LiDAR 分割和 3D 目标检测等多种下游感知任务中与现有 SOTA 方法相比具有竞争力,同时仅使用适度的 GPU 资源。我们在补充材料中提供了视频演示,代码可在 github.com/cskkxjk/Vampire 获取。

关键词

引用

@article{arxiv.2312.11837,
  title  = {Regulating Intermediate 3D Features for Vision-Centric Autonomous Driving},
  author = {Junkai Xu and Liang Peng and Haoran Cheng and Linxuan Xia and Qi Zhou and Dan Deng and Wei Qian and Wenxiao Wang and Deng Cai},
  journal= {arXiv preprint arXiv:2312.11837},
  year   = {2023}
}

备注

Accepted by AAAI 2024