中文

面向自动驾驶的无监督 3D 感知与 2D 视觉-语言蒸馏

计算机视觉与模式识别 2023-09-27 v1

摘要

仅在预定义对象类别集上训练的闭集 3D 感知模型,对于自动驾驶等安全关键应用可能不够充分,因为部署后可能遇到新的对象类型。本文中,我们提出一个多模态自动标注流水线,能够在无需 3D 人工标签的情况下为开放集类别生成 amodal 3D 边界框与轨迹(tracklets)以训练模型。我们的流水线利用点云序列中固有的运动线索,结合免费可用的 2D 图像-文本对,来识别并跟踪所有交通参与者。相较于该领域近期仅能提供限于运动对象、无类别区分的自动标签的研究,我们的方法能以无监督方式处理静态与运动对象,并得益于所提出的视觉-语言知识蒸馏而输出开放词汇语义标签。在 Waymo Open Dataset 上的实验表明,我们的方法在多项无监督 3D 感知任务上以显著优势超越先前工作。

关键词

引用

@article{arxiv.2309.14491,
  title  = {Unsupervised 3D Perception with 2D Vision-Language Distillation for Autonomous Driving},
  author = {Mahyar Najibi and Jingwei Ji and Yin Zhou and Charles R. Qi and Xinchen Yan and Scott Ettinger and Dragomir Anguelov},
  journal= {arXiv preprint arXiv:2309.14491},
  year   = {2023}
}

备注

ICCV 2023