语言驱动的占据预测
计算机视觉与模式识别
2025-07-31 v3
摘要
我们提出了 LOcc—a一个有效且可泛化的开放词汇占据 (OVO) 预测框架。以往方法通常通过图像特征作为中间层,利用粗糙的体素到文本对应关系来监督网络;或来自基于体素的模型视图投影的噪声且稀疏的对应关系。为缓解监督不准的问题,我们提出了语义传递标注管道,用于生成密集且细粒度的 3D 语言占据真实标签。我们的管道为从图像中挖掘有价值的语义信息,将文本标签从图像传递到激光点云,再传递到体素,从而建立精确的体素到文本对应关系。通过替换受监督占据模型的原始预测头,引入用于二值占据状态的几何头和用于语言特征的语言头,LOcc 有效地利用生成的语言真实标签指导 3D 语言体积的学习。在大量实验中,我们证明了我们的语义传递标注管道能够产生更准确的伪标签,减少了人工标注的工作量。此外,我们在各种体系结构上验证了 LOcc,所有模型在 Occ3D-nuScenes 数据集上均一致优于基于零样本占据预测的方法。
引用
@article{arxiv.2411.16072,
title = {Language Driven Occupancy Prediction},
author = {Zhu Yu and Bowen Pang and Lizhe Liu and Runmin Zhang and Qiang Li and Si-Yuan Cao and Maochun Luo and Mingxia Chen and Sheng Yang and Hui-Liang Shen},
journal= {arXiv preprint arXiv:2411.16072},
year = {2025}
}
备注
ICCV 2025; Project Page: https://github.com/pkqbajng/LOcc