中文

具有快速渲染与预训练视觉-语言对齐的通用机器人三维视觉-语言模型

计算机视觉与模式识别 2025-02-20 v2 机器人学

摘要

深度神经网络模型在三维场景理解方面取得了显著进展,但其训练于封闭集设定且使用全标签。然而,主要瓶颈在于这些模型无法在多样的真实世界应用中识别训练类别之外的任何未见新类别。因此,我们迫切需要一个可同时适用于三维点云分割与检测的框架,尤其在标签相当稀缺的情况下。本工作提出了一种通用且简洁的框架,用于处理标注场景相当有限时的三维场景理解。为从预训练的视觉-语言模型中提取新类别的知识,我们提出了分层特征对齐预训练与知识蒸馏策略,从大规模视觉-语言模型中提取并蒸馏有意义的信息,这有助于开放词汇场景理解任务。为鼓励潜在实例判别并保证效率,我们提出了针对点云的无监督区域级语义对比学习方案,利用神经网络的确信预测在多个阶段判别中间特征嵌入。在有限重建情况下,我们提出的方法称为WS3D++,在大规模ScanNet基准的语义分割与实例分割两项任务上均排名第1。室内外场景的大量实验证明了我们的方法在数据高效学习与开放世界少样本学习中的有效性。代码已公开于:https://drive.google.com/drive/folders/1M58V-PtR8DBEwD296zJkNg_m2qq-MTAP?usp=sharing。

关键词

引用

@article{arxiv.2312.00663,
  title  = {Generalized Robot 3D Vision-Language Model with Fast Rendering and Pre-Training Vision-Language Alignment},
  author = {Kangcheng Liu and Yong-Jin Liu and Baoquan Chen},
  journal= {arXiv preprint arXiv:2312.00663},
  year   = {2025}
}

备注

IEEE Transactions on Pattern Analysis and Machine Intelligence, Manuscript Info: 17 Pages, 13 Figures, and 6 Tables