GEOcc:基于隐式-显式深度融合与情境自监督的几何增强3D占用网络
计算机视觉与模式识别
2025-03-25 v2
摘要
3D 占用感知在近期以视觉为中心的自动驾驶系统中占据核心位置,通过将周围视角图像转换为密集3D网格中的集成几何与语义表示。然而,当前模型仍面临两个主要挑战:在2D-3D视图转换阶段准确建模深度,以及克服稀疏激光雷达监督导致的泛化性差的问题。为此,本文提出GEOcc(Geometric-Enhanced Occupancy),这是一种为视觉-only周围视角感知量身设计的几何增强占用网络。我们的方法具有三个方面:1)集成显式基于深度的预测与隐式投影变换的Transformer,以增强视图转换的密度和鲁棒性;2)采用基于掩码的编码器-解码器架构进行细粒度语义预测;3)在预训练阶段采用情境感知的自训练损失函数,以补充激光雷达监督,涉及从3D占用特征重新渲染2D深度图并利用图像重建损失获得更稠密的深度监督,除了稀疏激光雷达真实值之外。我们的方法在Occ3D-nuScenes数据集上实现了与当前模型相比,使用最少的图像分辨率和最轻量的图像主干网络,标志着因我们提出的贡献而实现了3.3%的性能提升。全面的实验也表明,我们的方法在基线和替代方法上始终具有优势。
引用
@article{arxiv.2405.10591,
title = {GEOcc: Geometrically Enhanced 3D Occupancy Network with Implicit-Explicit Depth Fusion and Contextual Self-Supervision},
author = {Xin Tan and Wenbin Wu and Zhiwei Zhang and Chaojie Fan and Yong Peng and Zhizhong Zhang and Yuan Xie and Lizhuang Ma},
journal= {arXiv preprint arXiv:2405.10591},
year = {2025}
}
备注
This work has been accepted for publication in IEEE Transactions on Intelligent Transportation Systems