中文

LOC: 一种通用的语言引导的开放集3D占用预测框架

计算机视觉与模式识别 2025-10-28 v1 计算与语言 机器学习 机器人学 图像与视频处理

摘要

视觉语言模型(VLM)在开放集挑战中取得了显著进展。然而,3D数据集的有限可用性阻碍了它们在3D场景理解中的有效应用。我们提出LOC,一个通用的语言引导框架,可适配各种占用网络,支持监督和自监督学习范式。对于自监督任务,我们采用一种融合多帧激光雷达点云进行动态/静态场景的策略,使用泊松重建填补空洞,并通过K近邻(KNN)为体素分配语义,以获得全面的体素表示。为缓解直接高维特征蒸馏导致的特征过度同质化,我们引入了密集对比学习(DCL)。DCL利用密集体素语义信息和预定义的文本提示。这无需密集的像素级监督即可有效增强开放集识别能力,我们的框架也可以利用现有的真实标签来进一步提升性能。我们的模型预测嵌入在CLIP特征空间中的密集体素特征,整合了文本和图像像素信息,并基于文本和语义相似度进行分类。在nuScenes数据集上的实验证明了该方法的优越性能,无需额外训练数据即可实现对已知类别的高精度预测和对未知类别的区分。

关键词

引用

@article{arxiv.2510.22141,
  title  = {LOC: A General Language-Guided Framework for Open-Set 3D Occupancy Prediction},
  author = {Yuhang Gao and Xiang Xiang and Sheng Zhong and Guoyou Wang},
  journal= {arXiv preprint arXiv:2510.22141},
  year   = {2025}
}