中文

Better Call SAL:迈向学习在 Lidar 中分割任意物体

计算机视觉与模式识别 2024-07-26 v2 机器人学

摘要

我们提出了 SAL(Segment Anything in Lidar)方法,该方法包含一个文本提示的零样本模型,用于分割和分类 Lidar 中的任意物体,以及一个无需人工监督即可促进模型训练的伪标签引擎。虽然 Lidar 全景分割(LPS)的既有范式依赖于对少量先验定义物体类别的手动监督,但我们利用 2D 视觉基础模型“免费”生成 3D 监督。我们的伪标签由实例掩码和相应的 CLIP token 组成,我们使用校准的多模态数据将其提升至 Lidar。通过在这些标签上训练模型,我们将 2D 基础模型蒸馏到我们的 Lidar SAL 模型中。即使没有手动标签,我们的模型在类别无关分割方面达到了 91%91\%,在零样本 Lidar 全景分割方面达到了全监督 SOTA 的 54%54\%。此外,我们优于多个不进行蒸馏而仅将图像特征提升至 3D 的基线。更重要的是,我们证明了 SAL 支持任意类别提示,可以轻松扩展到新数据集,并显示出随着自标注数据量增加而改进的巨大潜力。代码和模型可在该 \href\href{https://github.com/nv-dvl/segment-anything-lidar}{URL} 获取。

关键词

引用

@article{arxiv.2403.13129,
  title  = {Better Call SAL: Towards Learning to Segment Anything in Lidar},
  author = {Aljoša Ošep and Tim Meinhardt and Francesco Ferroni and Neehar Peri and Deva Ramanan and Laura Leal-Taixé},
  journal= {arXiv preprint arXiv:2403.13129},
  year   = {2024}
}

备注

Accepted to ECCV 2024