中文

ShapeLLM-Omni:用于 3D 生成与理解的原生多模态大语言模型

计算机视觉与模式识别 2025-06-03 v1

摘要

近期,ChatGPT-4o 强大的文本到图像能力引发了人们对原生多模态大语言模型的日益关注。然而,其多模态能力仍局限于图像和文本。但在图像之外,理解和生成 3D 内容的能力同样至关重要。为弥补这一空白,我们提出了 ShapeLLM-Omni——一种能够以任意序列理解和生成 3D 资产与文本的原生 3D 大语言模型。首先,我们训练了一个 3D 向量量化变分自编码器(VQVAE),将 3D 对象映射到离散潜在空间,以实现高效且准确的形状表示与重建。在具备 3D 感知的离散 token 基础上,我们创新性地构建了一个名为 3D-Alpaca 的大规模连续训练数据集,涵盖生成、理解和编辑,从而为未来的研究和训练提供丰富资源。最后,通过在 3D-Alpaca 数据集上对 Qwen-2.5-vl-7B-Instruct 模型执行基于指令的训练。我们的工作为扩展具备基础 3D 能力的多模态模型提供了一次有效的尝试,这将有助于未来 3D 原生 AI 的研究。项目页面:https://github.com/JAMESYJL/ShapeLLM-Omni

关键词

引用

@article{arxiv.2506.01853,
  title  = {ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding},
  author = {Junliang Ye and Zhengyi Wang and Ruowen Zhao and Shenghao Xie and Jun Zhu},
  journal= {arXiv preprint arXiv:2506.01853},
  year   = {2025}
}

备注

Project page: https://github.com/JAMESYJL/ShapeLLM-Omni