中文

MiniGPT-3D:利用 2D 先验高效对齐 3D 点云与大语言模型

计算机视觉与模式识别 2024-05-03 v1 人工智能 计算与语言 机器学习

摘要

大型 2D 视觉语言模型(2D-LLMs)通过使用简单的投影器将大语言模型(LLMs)与图像连接起来,引起了广泛关注。受其成功的启发,大型 3D 点云语言模型(3D-LLMs)也将点云集成到 LLMs 中。然而,直接将点云与 LLM 对齐需要高昂的训练成本,通常在 A100 上需要数百 GPU 小时,这阻碍了 3D-LLMs 的发展。本文介绍了 MiniGPT-3D,这是一种高效且强大的 3D-LLM,在单张 RTX 3090 上仅需 27 小时的训练即可实现多项 SOTA 结果。具体而言,我们提出利用来自 2D-LLMs 的 2D 先验将 3D 点云与 LLMs 对齐,这可以利用 2D 和 3D 视觉信息之间的相似性。我们引入了一种新颖的四阶段级联模态对齐训练策略,以及一个混合查询专家模块,以自适应且高效地聚合特征。此外,我们利用了参数高效微调方法 LoRA 和 Norm 微调,仅产生 47.8M 可学习参数,比现有方法少最多 260 倍。大量实验表明,MiniGPT-3D 在 3D 物体分类和描述任务上实现了 SOTA,且训练成本显著降低。值得注意的是,与 ShapeLLM-13B 相比,MiniGPT-3D 在具有挑战性的物体描述任务上的 GPT-4 评估分数提高了 8.12,而后者在 8 张 A800 上总共花费了 160 个 GPU 小时。我们是首个探索高效 3D-LLM 的工作,为社区提供了新的见解。代码和权重可在 https://github.com/TangYuan96/MiniGPT-3D 获取。

关键词

引用

@article{arxiv.2405.01413,
  title  = {MiniGPT-3D: Efficiently Aligning 3D Point Clouds with Large Language Models using 2D Priors},
  author = {Yuan Tang and Xu Han and Xianzhi Li and Qiao Yu and Yixue Hao and Long Hu and Min Chen},
  journal= {arXiv preprint arXiv:2405.01413},
  year   = {2024}
}

备注

17 pages, 9 figures