全稀疏 3D 占据预测
计算机视觉与模式识别
2024-07-22 v5
摘要
占据预测在自动驾驶中起着至关重要的作用。以往的方法通常构建稠密的 3D 体素,忽略了场景固有的稀疏性,并导致高昂的计算成本。为了弥合这一差距,我们引入了一种新颖的全稀疏占据网络,称为 SparseOcc。SparseOcc 首先从纯相机输入重建稀疏 3D 表示,随后通过稀疏查询从该 3D 稀疏表示预测语义/实例占据。我们设计了一种掩码引导的稀疏采样,使稀疏查询能够以全稀疏方式与 2D 特征交互,从而避免昂贵的稠密特征或全局注意力。此外,我们设计了一种深思熟虑的基于射线的评价指标,即 RayIoU,以解决传统体素级 mIoU 标准中沿深度轴产生的不一致惩罚问题。SparseOcc 展现了其有效性,在输入 7 帧历史帧的情况下,实现了 34.0 的 RayIoU,同时保持了 17.3 FPS 的实时推理速度。通过将更多前序帧增加到 15 帧,SparseOcc 在不使用任何特殊技巧的情况下将其性能持续提升至 35.1 RayIoU。
引用
@article{arxiv.2312.17118,
title = {Fully Sparse 3D Occupancy Prediction},
author = {Haisong Liu and Yang Chen and Haiguang Wang and Zetong Yang and Tianyu Li and Jia Zeng and Li Chen and Hongyang Li and Limin Wang},
journal= {arXiv preprint arXiv:2312.17118},
year = {2024}
}
备注
Accepted to ECCV 2024. Code: https://github.com/MCG-NJU/SparseOcc