MinkOcc:面向实时高效标签语义占据预测
计算机视觉与模式识别
2025-04-04 v1 机器人学
摘要
开发3D语义占据预测模型通常依赖于密集3D标注进行监督学习,这一过程既费时又耗资源,凸显了标签高效或无标签方法的需求。为此,我们引入MinkOcc,一个针对摄像头和LiDAR的多模态3D语义占据预测框架,提出了两步半监督训练程序。首先,使用小规模的明确3D标注数据进行训练预热;随后,通过更易标注的累积LiDAR扫描数据和图像——通过视觉基础模型进行语义标注——继续监督学习。MinkOcc有效利用这些传感器丰富的监督线索,显著减少了对手动标注的依赖(降低90%),同时保持竞争的准确性。此外,所提模型通过早期融合LiDAR和摄像头数据信息,并利用稀疏卷积网络实现实时预测。凭借在监督和计算两方面的效率优势,MinkOcc旨在超越精选数据集,使3D语义占据预测在自主驾驶领域的实际部署得以广泛应用。
引用
@article{arxiv.2504.02270,
title = {MinkOcc: Towards real-time label-efficient semantic occupancy prediction},
author = {Samuel Sze and Daniele De Martini and Lars Kunze},
journal= {arXiv preprint arXiv:2504.02270},
year = {2025}
}
备注
8 pages