中文

语言辅助的 3D 场景理解

计算机视觉与模式识别 2024-01-02 v2 机器人学

摘要

点云数据集的规模和质量制约了点云学习的进展。最近,随着多模态学习的发展,利用来自图像和文本等其他模态的领域无关先验知识来辅助点云特征学习被认为是一条充满希望的途径。现有方法已证明了多模态对比训练和特征蒸馏在点云上的有效性。然而,挑战依然存在,包括对配对三元组数据的需求、监督特征中的冗余与歧义,以及对原始先验的破坏。在本文中,我们提出了一种语言辅助的点云特征学习方法 (LAST-PCL),通过基于 LLM 的文本丰富化来增强语义概念。我们通过基于统计且无需训练的显著特征选择,在不损害文本先验的情况下实现了去冗余和特征降维。此外,我们还深入分析了文本对比训练对点云的影响。大量实验验证,所提出的方法能够学习具有语义意义的点云特征,并在 3D 语义分割、3D 物体检测和 3D 场景分类任务中实现了最先进 (SOTA) 或相当的性能。

关键词

引用

@article{arxiv.2312.11451,
  title  = {Language-Assisted 3D Scene Understanding},
  author = {Yanmin Wu and Qiankun Gao and Renrui Zhang and Jian Zhang},
  journal= {arXiv preprint arXiv:2312.11451},
  year   = {2024}
}

备注

Technical report, unpublished, 16 pages