L2COcc:基于 LiDAR 模型蒸馏的轻量级相机中心语义场景完成框架
计算机视觉与模式识别
2025-03-18 v1
摘要
语义场景完成(SSC)是自动驾驶感知系统中的关键要素,负责从感知数据推断场景的 3D 语义占据信息。为提高准确性,先前的研究采用各种计算密集和内存密集的 3D 操作,在训练和测试期间对平台提出了显著的计算要求。本文提出了 L2COcc,一种轻量级相机中心 SSC 框架,同时支持 LiDAR 输入。通过我们提出的高效体素变换器(EVT)和跨模态知识模块,包括特征相似性蒸馏(FSD)、TPV 蒸馏(TPVD)和预测对齐蒸馏(PAD),我们的方法显著降低了计算负担,同时保持了高准确率。实验评估表明,我们提出的方法在 SemanticKITTI 和 SSCBench-KITTI-360 基准测试中分别优于当前基于视觉的 SSC 方法,准确率更高。此外,我们的方法更轻量级,相对于当前最先进的方法,在内存消耗和推理时间上分别降低了超过 23%。代码已公开于我们的项目页面:https://studyingfufu.github.io/L2COcc/。
引用
@article{arxiv.2503.12369,
title = {L2COcc: Lightweight Camera-Centric Semantic Scene Completion via Distillation of LiDAR Model},
author = {Ruoyu Wang and Yukai Ma and Yi Yao and Sheng Tao and Haoang Li and Zongzhi Zhu and Yong Liu and Xingxing Zuo},
journal= {arXiv preprint arXiv:2503.12369},
year = {2025}
}