ULIP-2:面向可扩展多模态预训练的三维理解框架
计算机视觉与模式识别
2024-04-29 v4
摘要
多模态预训练的最新进展通过将三维形状、其二维对应物与语言描述之间的多模态特征对齐,在三维表征学习中展现出良好的效果。然而,现有框架用于整理此类多模态数据(尤其是三维形状的语言描述)的方法不可扩展,且所收集的语言描述缺乏多样性。为此,我们提出 ULIP-2,一种简单而有效的三模态预训练框架,利用大型多模态模型自动为三维形状生成整体性的语言描述。它仅需以三维数据作为输入,无需任何人工三维标注,因此可扩展至大规模数据集。ULIP-2 还配备了扩展的主干网络以更好地进行多模态表征学习。我们在两个大规模三维数据集 Objaverse 和 ShapeNet 上进行实验,并用三维点云、图像和语言的三模态数据集对其进行扩充以训练 ULIP-2。实验表明,ULIP-2 在三项下游任务中展现出显著优势:零样本三维分类、微调标准三维分类,以及三维描述生成(三维到语言生成)。在零样本分类中,它在 Objaverse-LVIS 上取得 50.6%(top-1)的新 SOTA,在 ModelNet40 上取得 84.7%(top-1)。在用于标准微调的 ScanObjectNN 基准上,ULIP-2 以仅 140 万参数的紧凑模型达到 91.5% 的总体准确率。ULIP-2 揭示了无需人工标注的可扩展多模态三维表征学习新范式,并相较现有基线有显著提升。代码与数据集发布于 https://github.com/salesforce/ULIP。
引用
@article{arxiv.2305.08275,
title = {ULIP-2: Towards Scalable Multimodal Pre-training for 3D Understanding},
author = {Le Xue and Ning Yu and Shu Zhang and Artemis Panagopoulou and Junnan Li and Roberto Martín-Martín and Jiajun Wu and Caiming Xiong and Ran Xu and Juan Carlos Niebles and Silvio Savarese},
journal= {arXiv preprint arXiv:2305.08275},
year = {2024}
}
备注
CVPR2024