HybridOcc:NeRF增强的基于Transformer的多相机3D占用预测
计算机视觉与模式识别
2024-08-20 v1
摘要
基于视觉的3D语义场景补全(SSC)通过3D体积表示来描述自动驾驶场景。然而,场景表面对不可见体素的遮挡给当前SSC方法在幻觉化精细3D几何方面带来了挑战。本文提出HybridOcc,这是一种由Transformer框架和NeRF表示生成,并在由粗到精的SSC预测框架中细化的混合3D体积查询提议方法。HybridOcc基于混合查询提议,通过Transformer范式聚合上下文特征,同时结合NeRF表示以获得深度监督。Transformer分支包含多个尺度,并使用空间交叉注意力进行2D到3D的转换。新设计的NeRF分支通过体积渲染隐式推断场景占用,包括可见和不可见体素,并显式捕获场景深度而非生成RGB颜色。此外,我们提出了一种创新的占用感知光线采样方法,以引导SSC任务而非聚焦于场景表面,从而进一步提升整体性能。在nuScenes和SemanticKITTI数据集上的大量实验证明了我们的HybridOcc在SSC任务上的有效性。
引用
@article{arxiv.2408.09104,
title = {HybridOcc: NeRF Enhanced Transformer-based Multi-Camera 3D Occupancy Prediction},
author = {Xiao Zhao and Bo Chen and Mingyang Sun and Dingkang Yang and Youxing Wang and Xukun Zhang and Mingcheng Li and Dongliang Kou and Xiaoyi Wei and Lihua Zhang},
journal= {arXiv preprint arXiv:2408.09104},
year = {2024}
}
备注
Accepted to IEEE RAL