中文

文本与三维点云的联合表示学习

计算机视觉与模式识别 2023-01-19 v1 人工智能 机器学习

摘要

视觉-语言预训练(如 CLIP)的最新进展表明,视觉模型可受益于语言监督。尽管许多使用语言模态的模型在 2D 视觉任务上取得了巨大成功,但由于 3D-文本数据对获取困难以及 3D 数据结构的不规则性,文本与三维点云的联合表示学习仍待探索。本文提出一种新颖的 Text4Point 框架,以构建语言引导的三维点云模型。其核心思想是利用 2D 图像作为桥梁连接点云与语言模态。所提出的 Text4Point 遵循预训练与微调范式。在预训练阶段,我们基于现成的 RGB-D 数据建立图像与点云的对应关系,并使用对比学习对齐图像与点云表示。结合 CLIP 已良好对齐的图像与文本特征,点云特征被隐式地与文本嵌入对齐。进一步,我们提出一个文本查询模块,通过以点云特征查询文本嵌入,将语言信息整合进 3D 表示学习。在微调阶段,模型在来自标签集的富有信息量的语言引导下,无需 2D 图像即可学习任务特定的 3D 表示。大量实验表明,我们的模型在多种下游任务(如点云语义分割、实例分割与目标检测)上均展现出一致的提升。代码将发布于:https://github.com/LeapLabTHU/Text4Point

关键词

引用

@article{arxiv.2301.07584,
  title  = {Joint Representation Learning for Text and 3D Point Cloud},
  author = {Rui Huang and Xuran Pan and Henry Zheng and Haojun Jiang and Zhifeng Xie and Shiji Song and Gao Huang},
  journal= {arXiv preprint arXiv:2301.07584},
  year   = {2023}
}