SparseOcc:重新思考基于视觉的语义占用预测的稀疏潜在表示
计算机视觉与模式识别
2024-04-16 v1
摘要
自动驾驶的基于视觉的感知需要对 3D 空间进行显式建模,其中映射 2D 潜在表示并随后应用 3D 算子。然而,在密集潜在空间上进行操作会引入三次时间和空间复杂度,这限制了在感知范围或空间分辨率方面的可扩展性。现有方法使用鸟瞰图 (BEV) 或三视角图 (TPV) 等投影来压缩密集表示。虽然高效,但这些投影会导致信息丢失,特别是对于语义占用预测等任务。为了解决这个问题,我们提出了 SparseOcc,一种受稀疏点云处理启发的高效占用网络。它利用了无损稀疏潜在表示,具有三个关键创新。首先,3D 稀疏散射器使用空间分解的 3D 稀疏卷积核执行潜在补全。其次,特征金字塔和稀疏插值利用来自其他尺度的信息增强各尺度。最后,transformer 头被重新设计为稀疏变体。SparseOcc 在密集基线上实现了 74.9% 的 FLOPs 显著减少。有趣的是,它还提高了准确率,mIOU 从 12.8% 提高到 14.1%,这部分归因于稀疏表示避免在空白体素上产生幻觉的能力。
引用
@article{arxiv.2404.09502,
title = {SparseOcc: Rethinking Sparse Latent Representation for Vision-Based Semantic Occupancy Prediction},
author = {Pin Tang and Zhongdao Wang and Guoqing Wang and Jilai Zheng and Xiangxuan Ren and Bailan Feng and Chao Ma},
journal= {arXiv preprint arXiv:2404.09502},
year = {2024}
}
备注
10 pages, 4 figures, accepted by CVPR 2024