OccFormer:用于基于视觉的3D语义占据预测的双路径Transformer
计算机视觉与模式识别
2023-04-12 v1
摘要
自动驾驶的基于视觉的感知已从鸟瞰图(BEV)表示转变为3D语义占据。与BEV平面相比,3D语义占据进一步提供了沿垂直方向的结构信息。本文提出OccFormer,一种双路径Transformer网络,用于有效处理3D体素以进行语义占据预测。OccFormer通过对相机生成的3D体素特征沿水平面分解为局部和全局Transformer路径,实现了长程、动态且高效的编码。对于占据解码器,我们通过提出preserve-pooling和class-guided sampling,将原始的Mask2Former适配于3D语义占据,这显著缓解了稀疏性和类别不平衡问题。实验结果表明,OccFormer在SemanticKITTI数据集上的语义场景补全任务以及nuScenes数据集上的LiDAR语义分割任务中均显著优于现有方法。代码已发布于\url{https://github.com/zhangyp15/OccFormer}。
引用
@article{arxiv.2304.05316,
title = {OccFormer: Dual-path Transformer for Vision-based 3D Semantic Occupancy Prediction},
author = {Yunpeng Zhang and Zheng Zhu and Dalong Du},
journal= {arXiv preprint arXiv:2304.05316},
year = {2023}
}
备注
Code is available at https://github.com/zhangyp15/OccFormer