基于多层表示融合的补充信息引导占用预测
计算机视觉与模式识别
2025-10-16 v1
摘要
基于摄像头的占用预测是自动驾驶中进行三维感知的主流方法,旨在从二维图像中推断完整的三维场景几何与语义。几乎所有现有方法都致力于通过结构性修改(如轻量化主干网络和复杂的级联框架)来提升性能,虽然已取得良好效果,但仍存在局限。少数研究从表示融合的角度进行探讨,未能充分利用二维图像中丰富的特征多样性。为此,我们提出了一种基于多层表示融合的占用预测框架——\textbf{CIGOcc}。\textbf{CIGOcc}从输入图像中提取分割、图形和深度特征,并引入可变形的多层融合机制来融合这三类多层特征。此外,CIGOcc还 incorporates 来自 SAM 的知识,以进一步提升预测准确性。无需增加训练成本,CIGOcc 在 SemanticKITTI 数据集上实现了最先进的性能。代码已在补充材料中提供,并将发布于 https://github.com/VitaLemonTea1/CIGOcc
关键词
引用
@article{arxiv.2510.13198,
title = {Complementary Information Guided Occupancy Prediction via Multi-Level Representation Fusion},
author = {Rongtao Xu and Jinzhou Lin and Jialei Zhou and Jiahua Dong and Changwei Wang and Ruisheng Wang and Li Guo and Shibiao Xu and Xiaodan Liang},
journal= {arXiv preprint arXiv:2510.13198},
year = {2025}
}