GraphGSOcc:基于动态-静态解耦的3D高斯溅写语义-几何图变换器用于占据预测
计算机视觉与模式识别
2026-02-23 v2 人工智能
摘要
针对自动驾驶的3D语义占据预测任务,我们解决现有3D高斯溅写(3DGS)方法的两个关键问题:(1)统一特征聚合忽略了相似类别之间以及跨区域的语义关联;(2)由于MLP迭代优化中缺乏几何约束,导致边界模糊;(3)动态-静态物体耦合优化存在偏差问题。我们提出GraphGSOcc模型,一种结合语义和几何图变换器并为3D高斯溅写占据预测解耦动态-静态物体优化的新框架。我们提出Dual Gaussians Graph Attention机制,动态构建两种图结构:几何图基于高斯姿态自适应计算KNN搜索半径,使大规模高斯能从更广阔的邻域聚集特征,同时紧凑高斯聚焦于局部几何一致性;语义图通过余弦相似度保留top-M个高度关联的节点,显式编码区域内及跨实例的语义关系。结合多尺度图注意力框架,较低层实现细粒度注意力以优化边界细节,较高层实现粗粒度注意力以建模对象级拓扑。另一方面,我们利用语义概率分布解耦动态和静态物体,设计Dynamic-Static Decoupled Gaussian Attention机制以优化动态物体和静态场景的预测性能。GraphGSOcc在SurroundOcc-nuScenes、Occ3D-nuScenes、OpenOcc和KITTI占据基准测试中实现了最先进的性能。在SurroundOcc数据集上实现mIoU为25.20%,GPU内存降至6.8 GB,较GaussianWorld实现1.97% mIoU提升和13.7%内存降低。
引用
@article{arxiv.2506.14825,
title = {GraphGSOcc: Semantic-Geometric Graph Transformer with Dynamic-Static Decoupling for 3D Gaussian Splatting-based Occupancy Prediction},
author = {Ke Song and Yunhe Wu and Chunchit Siu and Huiyuan Xiong},
journal= {arXiv preprint arXiv:2506.14825},
year = {2026}
}