中文

基于2D-3D视觉语言蒸馏的3D开放词汇全景分割

计算机视觉与模式识别 2024-04-04 v3

摘要

3D全景分割是一项具有挑战性的感知任务,尤其是在自动驾驶中。它旨在预测场景中3D点的语义和实例标注。尽管先前的3D全景分割方法在封闭集基准上取得了很好的性能,但将这些方法泛化到未见过的物体和未见过的类别仍然是一个开放问题。对于未见过的物体类别,2D开放词汇分割已经取得了有希望的结果,这些结果仅依赖于冻结的CLIP骨干网络和集成多个分类输出。然而,我们发现简单地将这些2D模型扩展到3D并不能保证良好的性能,因为每个掩码的分类质量较差,尤其是对于新的类别。在本文中,我们提出了第一种解决3D开放词汇全景分割的方法。我们的模型利用了可学习的LiDAR特征与密集的冻结视觉CLIP特征之间的融合,使用单个分类头对基类和新类进行预测。为了进一步提高新类的分类性能并利用CLIP模型,我们提出了两个新的损失函数:对象级蒸馏损失和体素级蒸馏损失。我们在nuScenes和SemanticKITTI数据集上的实验表明,我们的方法以较大优势优于强基线。

关键词

引用

@article{arxiv.2401.02402,
  title  = {3D Open-Vocabulary Panoptic Segmentation with 2D-3D Vision-Language Distillation},
  author = {Zihao Xiao and Longlong Jing and Shangxuan Wu and Alex Zihao Zhu and Jingwei Ji and Chiyu Max Jiang and Wei-Chih Hung and Thomas Funkhouser and Weicheng Kuo and Anelia Angelova and Yin Zhou and Shiwei Sheng},
  journal= {arXiv preprint arXiv:2401.02402},
  year   = {2024}
}