通过几何-语义解耦实现实时3D占用预测
计算机视觉与模式识别
2024-07-23 v2
摘要
占用预测在自动驾驶(AD)中起着关键作用,due to其细粒度的几何感知和通用目标识别能力。然而,现有方法往往产生高计算成本,与AD的实时需求相矛盾。为此,我们首先评估了大多数公开方法的速度和内存使用情况,以将注意力从仅关注准确度转向也考虑效率。我们然后识别了实现快速且准确性能的核心挑战:**几何与语义之间的强耦合**。为解决此问题,1)我们提出了几何-语义双分支网络(GSDBN),采用混合BEV-Voxel表示。在BEV分支中,引入了BEV级别的时序融合模块和U-Net编码器来提取稠密语义特征。在体素分支中,提出了大核重参数化3D卷积来细化稀疏3D几何并降低计算。此外,我们提出了一种新的BEV-体素升压模块,将BEV特征投射到体素空间以进行特征融合。在网络设计之外,2)我们还提出了几何-语义解耦学习(GSDL)策略。该策略最初使用真实深度学习语义,以准确的几何为基础,然后逐渐混合预测深度以适应预测的几何。广泛的在Occ3D-nuScenes基准上的实验表明,我们的方法优于现有方法,实现了39.4 mIoU和20.0 FPS。这一结果比CVPR2023 3D占用预测挑战获胜者FB-OCC快约3倍,mIoU提高1.9。我们的代码将公开源码。
引用
@article{arxiv.2407.13155,
title = {Real-Time 3D Occupancy Prediction via Geometric-Semantic Disentanglement},
author = {Yulin He and Wei Chen and Tianci Xun and Yusong Tan},
journal= {arXiv preprint arXiv:2407.13155},
year = {2024}
}