中文

VESPA:面向自动驾驶的免人工监督开放世界点云标注

计算机视觉与模式识别 2025-07-29 v1

摘要

自动驾驶的数据收集正在迅速加速,但手动标注,尤其是3D标签,由于其高昂的成本和劳动强度,仍然是一个主要瓶颈。自动标注已成为一种可扩展的替代方案,允许在最少人工干预的情况下为点云生成标签。虽然基于LiDAR的自动标注方法利用了几何信息,但它们难以应对激光雷达数据固有的局限性,例如稀疏性、遮挡和不完整的物体观测。此外,这些方法通常以类别无关的方式运行,提供的语义粒度有限。为了应对这些挑战,我们引入了VESPA,一个多模态自动标注流水线,它融合了LiDAR的几何精度与相机图像的语义丰富性。我们的方法利用视觉-语言模型(VLM)实现开放词汇的物体标注,并直接在点云域中优化检测质量。VESPA支持发现新类别,并生成高质量的3D伪标签,无需真实标注或高清地图。在Nuscenes数据集上,VESPA在物体发现方面达到了52.95%的AP,在多类别物体检测方面达到了46.54%的AP,展示了在可扩展的3D场景理解中的强大性能。代码将在接收后公开。

关键词

引用

@article{arxiv.2507.20397,
  title  = {VESPA: Towards un(Human)supervised Open-World Pointcloud Labeling for Autonomous Driving},
  author = {Levente Tempfli and Esteban Rivera and Markus Lienkamp},
  journal= {arXiv preprint arXiv:2507.20397},
  year   = {2025}
}