EFFOcc:从最小标签学习高效占据网络
计算机视觉与模式识别
2025-04-09 v2
摘要
3D 占据预测(3DOcc)是自动驾驶领域中日益增长且具有挑战性的感知任务。现有的 3D 占据网络(OccNets)计算负担沉重且对标签要求高。就模型复杂度而言,OccNets 通常由体素级别的重型 Conv3D 模块或 Transformer 组成。此外,OccNets 使用高成本的大规模稠密体素标签进行监督。由过多网络参数和标签标注需求导致的模型和数据效率问题,严重阻碍了 OccNets 在 onboard 部署。本文提出了面向最小网络复杂度和标签要求的高效占据学习框架,名为 EFFOcc,旨在实现最先进的准确度。我们首先提出了一种高效融合式 OccNet,仅使用简单的 2D 算子,已在三个大规模基准数据集上将准确率提升至最先进水平:Occ3D-nuScenes、Occ3D-Waymo 和 OpenOccupancy-nuScenes。在 Occ3D-nuScenes 基准测试中,采用 ResNet-18 作为图像骨干网络的融合式模型具有 21.35M 参数,并以平均交并比(mIoU)51.49 的成绩取得优异成绩。进一步,我们提出了一种面向占据的多阶段知识蒸馏,以高效将知识传递给仅依赖视觉的 OccNet。大量实验表明,在占据基准测试中,融合式和视觉式 OccNets 均实现了最先进的精度。为展示在有限标签下学习的效果,我们仅使用 40% 标记序列和来自融合式 OccNet 的蒸馏,即可达到 100% 标记视觉 OccNet(mIoU=30.07)性能的 94.38%(mIoU=28.38)。
引用
@article{arxiv.2406.07042,
title = {EFFOcc: Learning Efficient Occupancy Networks from Minimal Labels for Autonomous Driving},
author = {Yining Shi and Kun Jiang and Jinyu Miao and Ke Wang and Kangan Qian and Yunlong Wang and Jiusi Li and Tuopu Wen and Mengmeng Yang and Yiliang Xu and Diange Yang},
journal= {arXiv preprint arXiv:2406.07042},
year = {2025}
}
备注
Code at https://github.com/synsin0/EFFOcc