LangOcc:基于体积渲染的自监督开词汇占据估计
计算机视觉与模式识别
2024-07-26 v2
摘要
3D 占据估计任务近年来在基于视觉的自动驾驶领域成为重要挑战。然而,大多数现有基于摄像头的方法依赖昂贵的3D体素标签或激光扫描数据进行训练,限制了其实用性和可扩展性。此外,大多数方法都局限于预定义的类别集合。本文提出了一种 novel 方法用于开词汇占据估计,称为 LangOcc,仅通过摄像头图像进行训练,可检测任意语义。具体而言,我们通过可微体积渲染将强视觉-语言对齐编码器 CLIP 的知识蒸馏到3D占据模型中。我们的模型仅使用图像即可在3D体素网格中估计视觉-语言对齐特征。通过将我们的估计重新渲染到2D空间进行训练,模型可自主计算 ground-truth 特征,从而自动监督场景几何,实现无需显式几何监督的直观且强大的训练方法。LangOcc 在开词汇占据估计中显著优于基于LiDAR的竞争方法,仅依赖基于视觉的训练。我们还在 Occ3D-nuScenes 数据集上实现了自监督语义占据估计的state-of-the-art结果,尽管未受特定类别限制,证明了我们方法的有效性。
引用
@article{arxiv.2407.17310,
title = {LangOcc: Self-Supervised Open Vocabulary Occupancy Estimation via Volume Rendering},
author = {Simon Boeder and Fabian Gigengack and Benjamin Risse},
journal= {arXiv preprint arXiv:2407.17310},
year = {2024}
}