中文

在对比语言-图像-三维预训练中塑造整体三维表示

计算机视觉与模式识别 2024-04-08 v2

摘要

对比学习已成为三维开放世界理解的一种有前景的范式,即分别将点云表示对齐到图像和文本嵌入空间。本文中,我们提出 MixCon3D,一种简单而有效的方法,旨在对比语言-图像-三维预训练中塑造整体三维表示。与点云本身不同,我们从互补的视角(例如带点云的多视图渲染图像)开发三维物体级表示。随后,MixCon3D 执行语言-三维对比学习,全面刻画真实世界的三维物体并增强文本对齐。此外,我们率先对三维对比学习范式的各种训练策略进行了首次透彻研究,构建了具有改进性能的坚实基础基线。在三个代表性基准上进行的广泛实验表明,我们的方法显著优于基线,在具有挑战性的 1,156 类 Objaverse-LVIS 数据集上以 5.7% 超越先前的最优(state-of-the-art)性能。MixCon3D 的通用性在文本到三维检索和点云描述生成等应用中得到展示,进一步证明了其在多样场景中的有效性。代码见 https://github.com/UCSC-VLAA/MixCon3D。

关键词

引用

@article{arxiv.2311.01734,
  title  = {Sculpting Holistic 3D Representation in Contrastive Language-Image-3D Pre-training},
  author = {Yipeng Gao and Zeyu Wang and Wei-Shi Zheng and Cihang Xie and Yuyin Zhou},
  journal= {arXiv preprint arXiv:2311.01734},
  year   = {2024}
}

备注

Accepted by CVPR 2024