中文

Cube:Roblox 3D 智能的一种视角

计算机视觉与模式识别 2025-07-22 v3

摘要

在大规模数据上训练的基础模型已在文本、图像、音频和视频等领域展示出惊人的推理和生成能力。我们目标是为3D智能构建这样一种基础模型,该模型能够支持开发人员从生成3D对象和场景、为动画绑定角色到生成描述对象行为的程序化脚本等方面全面生产Roblox体验。我们讨论了构建此类3D基础模型的三个关键设计要求,然后提出了我们构建此类模型的第一步。我们期望3D几何形状将是核心数据类型,并描述了我们的3D形状分词器解决方案。我们展示了这种分词方案如何用于文本到形状生成、形状到文本生成和文本到场景生成等应用。我们演示了这些应用程序如何与现有的大型语言模型(LLMs)协作,以执行场景分析和推理。我们以讨论概述了构建完全统一的3D智能基础模型的道路。

关键词

引用

@article{arxiv.2503.15475,
  title  = {Cube: A Roblox View of 3D Intelligence},
  author = {Foundation AI Team and Kiran Bhat and Nishchaie Khanna and Karun Channa and Tinghui Zhou and Yiheng Zhu and Xiaoxia Sun and Charles Shang and Anirudh Sudarshan and Maurice Chu and Daiqing Li and Kangle Deng and Jean-Philippe Fauconnier and Tijmen Verhulsdonck and Maneesh Agrawala and Kayvon Fatahalian and Alexander Weiss and Christian Reiser and Ravi Kiran Chirravuri and Ravali Kandur and Alejandro Pelaez and Akash Garg and Michael Palleschi and Jessica Wang and Skylar Litz and Leon Liu and Anying Li and David Harmon and Derek Liu and Liangjun Feng and Denis Goupil and Lukas Kuczynski and Jihyun Yoon and Naveen Marri and Peiye Zhuang and Yinan Zhang and Brian Yin and Haomiao Jiang and Marcel van Workum and Thomas Lane and Bryce Erickson and Salil Pathare and Kyle Price and Steve Han and Yiqing Wang and Anupam Singh and David Baszucki},
  journal= {arXiv preprint arXiv:2503.15475},
  year   = {2025}
}

备注

Our code and model weights can be found at: https://github.com/Roblox/cube