中文

GaussianFormer:以高斯表示场景的视觉 3D 语义占据预测

计算机视觉与模式识别 2024-05-28 v1 人工智能

摘要

3D 语义占据预测旨在获取周围场景的 3D 细粒度几何与语义,是视觉中心自动驾驶鲁棒性的重要任务。现有大多数方法采用诸如体素等稠密网格作为场景表示,忽略了占据的稀疏性和物体尺度的多样性,从而导致资源分配不均。为了解决这一问题,我们提出了一种以物体为中心的表示方法,用稀疏的 3D 语义高斯来描述 3D 场景,其中每个高斯表示一个灵活的感兴趣区域及其语义特征。我们通过注意力机制从图像中聚合信息,并迭代地细化 3D 高斯的属性,包括位置、协方差和语义。然后,我们提出了一种高效的从高斯到体素的溅射方法来生成 3D 占据预测,该方法仅聚合特定位置邻近的高斯。我们在广泛采用的 nuScenes 和 KITTI-360 数据集上进行了大量实验。实验结果表明,GaussianFormer 仅用 17.8% - 24.8% 的内存消耗就达到了与 SOTA 方法相当的性能。代码获取地址:https://github.com/huang-yh/GaussianFormer。

关键词

引用

@article{arxiv.2405.17429,
  title  = {GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction},
  author = {Yuanhui Huang and Wenzhao Zheng and Yunpeng Zhang and Jie Zhou and Jiwen Lu},
  journal= {arXiv preprint arXiv:2405.17429},
  year   = {2024}
}

备注

Code is available at: https://github.com/huang-yh/GaussianFormer