中文

PointLLM:赋予大语言模型理解点云的能力

计算机视觉与模式识别 2024-09-10 v3 人工智能 计算与语言

摘要

大语言模型(LLMs)前所未有的进展已对自然语言处理产生深远影响,但尚未充分拥抱 3D 理解的领域。本文介绍 PointLLM,一项填补此空白的初步努力,使 LLMs 能够理解点云,并提供超越 2D 视觉数据的新途径。PointLLM 理解带颜色的对象点云与人类指令,并生成语境恰当的响应,展现其对点云与常识的把握。具体而言,它利用点云编码器与强大的 LLM 有效融合几何、外观与语言信息。我们收集了包含 660K 简单与 70K 复杂点-文本指令对的新数据集,以实现两阶段训练策略:对齐潜空间并随后对统一模型进行指令微调。为严格评估 PointLLM 的感知与泛化能力,我们建立了两个基准:生成式 3D 对象分类与 3D 对象描述,并通过包括人工评估、GPT-4/ChatGPT 评估与传统指标在内的三种不同方法进行评测。实验结果显示 PointLLM 优于现有 2D 与 3D 基线,在人工评估的对象描述任务中取得显著成就,在超过 50% 的样本中超越人类标注者。代码、数据集与基准发布于 https://github.com/OpenRobotLab/PointLLM 。

关键词

引用

@article{arxiv.2308.16911,
  title  = {PointLLM: Empowering Large Language Models to Understand Point Clouds},
  author = {Runsen Xu and Xiaolong Wang and Tai Wang and Yilun Chen and Jiangmiao Pang and Dahua Lin},
  journal= {arXiv preprint arXiv:2308.16911},
  year   = {2024}
}

备注

ECCV 2024 Oral Camera Ready. This version includes clearer writing and additional experimental results compared to previous versions. Project page: https://runsenxu.com/projects/PointLLM