中文

ULIP:学习用于3D理解的语言、图像与点云的统一表示

计算机视觉与模式识别 2023-06-14 v4

摘要

当前最先进3D模型的识别能力受限于标注数据量少且类别集合预定义的数据库。在其2D对应领域中,近期进展表明,通过利用来自其他模态(如语言)的知识可显著缓解类似问题。受此启发,在受限数据条件下,借助多模态信息改进3D模态有望提升3D理解,但这一研究方向尚缺乏充分研究。因此,我们引入ULIP,通过利用来自三种模态的对象三元组进行预训练,学习图像、文本与3D点云的统一表示。为克服训练三元组的短缺,ULIP借助已在海量图像-文本对上训练并习得公共视觉与文本空间的预训练视觉-语言模型。随后,ULIP利用少量自动合成的三元组,学习与该公共图像-文本空间对齐的3D表示空间。ULIP对3D骨干网络具有无关性,可轻松集成至任意3D架构中。实验表明,ULIP通过仅在我们的框架上使用ShapeNet55对多个近期3D骨干进行预训练,便有效提升了其性能,在ModelNet40和ScanObjectNN上的标准3D分类与零样本3D分类中均达到最先进性能。ULIP还在ScanObjectNN的3D分类上将PointMLP的性能提升约3%,并在ModelNet40的零样本3D分类上以28.8%的top-1准确率优势超越PointCLIP。我们的代码与预训练模型发布于https://github.com/salesforce/ULIP。

关键词

引用

@article{arxiv.2212.05171,
  title  = {ULIP: Learning a Unified Representation of Language, Images, and Point Clouds for 3D Understanding},
  author = {Le Xue and Mingfei Gao and Chen Xing and Roberto Martín-Martín and Jiajun Wu and Caiming Xiong and Ran Xu and Juan Carlos Niebles and Silvio Savarese},
  journal= {arXiv preprint arXiv:2212.05171},
  year   = {2023}
}

备注

Accepted by CVPR 2023