SliceSemOcc:基于垂直切片的多模态3D语义占据表示
计算机视觉与模式识别
2025-09-05 v1
摘要
随着自动驾驶对精准3D感知需求的增长,3D语义占据预测成为关键研究热点。不同于限制于二维平面的鸟瞰视图( BEV)方法,占据预测利用完整的3D体素网格在所有维度中建模空间结构,从而捕获垂直轴方向的语义变化。然而,现有大多数方法在处理体素特征时忽略了高度轴信息。常规的SENet风格通道注意力机制在所有高度层上分配均匀权重,限制了其在不同高度处强调特征的能力。为此,我们提出SliceSemOcc——一种基于垂直切片的多模态3D语义占据表示框架。具体而言,我们通过全局垂直切片和局部垂直切片提取高度轴方向的体素特征。随后,一个全局-局部融合模块自适应地整合细粒度的空间细节与整体上下文信息。进一步,我们提出SEAttention3D模块,通过平均池化保持高度维分辨率,并为每个高度层分配动态通道注意力权重。在nuScenes-SurroundOcc和nuScenes-OpenOccupancy数据集上进行的广泛实验表明,我们的方法显著提升了平均IoU,尤其在大多数小目标类别上取得显著提升。详细的消融研究进一步验证了SliceSemOcc框架的有效性。
关键词
引用
@article{arxiv.2509.03999,
title = {SliceSemOcc: Vertical Slice Based Multimodal 3D Semantic Occupancy Representation},
author = {Han Huang and Han Sun and Ningzhong Liu and Huiyu Zhou and Jiaquan Shen},
journal= {arXiv preprint arXiv:2509.03999},
year = {2025}
}
备注
14 pages, accepted by PRCV2025