OccTransformer:改进BEVFormer以实现仅基于摄像头的3D占用预测
计算机视觉与模式识别
2024-02-29 v1
摘要
本技术报告介绍了我们在CVPR 2023自动驾驶挑战赛3D占用预测赛道中的解决方案“occTransformer”。我们的方法基于强大的基线BEVFormer,并通过若干简单而有效的技术提升了其性能。首先,我们采用数据增强来增加训练数据的多样性并提高模型的泛化能力。其次,我们使用强大的图像骨干网络从输入数据中提取更具信息量的特征。第三,我们引入了3D UNet头部以更好地捕捉场景的空间信息。第四,我们增加了更多损失函数以更好地优化模型。此外,我们采用了集成方法,结合了occ模型BevDet和SurroundOcc以进一步提升性能。最重要的是,我们集成了3D检测模型StreamPETR,以增强模型检测场景中物体的能力。通过这些方法,我们的解决方案在自动驾驶挑战赛的3D占用预测赛道上达到了49.23的mIoU。
引用
@article{arxiv.2402.18140,
title = {OccTransformer: Improving BEVFormer for 3D camera-only occupancy prediction},
author = {Jian Liu and Sipeng Zhang and Chuixin Kong and Wenyuan Zhang and Yuhang Wu and Yikang Ding and Borun Xu and Ruibo Ming and Donglai Wei and Xianming Liu},
journal= {arXiv preprint arXiv:2402.18140},
year = {2024}
}
备注
Innovation Award in the 3D Occupancy Prediction Challenge (CVPR23)