中文

GigaWorld-0:作为数据引擎的世界模型以赋能具身 AI

计算机视觉与模式识别 2025-12-02 v2 机器人学

摘要

世界模型正在成为可扩展、数据高效具身 AI 的基础范式。本文提出 GigaWorld-0,一个专为视觉-语言-动作 (VLA) 学习设计的统一世界模型框架。GigaWorld-0 集成了两个协同组件:GigaWorld-0-Video 利用大规模视频生成产生多样化、纹理丰富且时间上连贯的具身序列,受细粒度控制约束,包括外观、相机视角和动作语义;GigaWorld-0-3D 融合 3D 生成建模、3D 高斯溅射重建、物理可微系统识别和可执行运动规划,确保几何一致性和物理真实性。它们的联合优化使具身交互数据的可扩展合成具备视觉吸引力、空间连贯性、物理可信度和指令对齐。通过我们的高效 GigaTrain 框架实现大规模训练,该框架利用 FP8 精度和稀疏注意力显著降低内存和计算需求。我们进行了全面评估,表明 GigaWorld-0 在多个维度上生成高质量、多样化且可控的数据。关键的是,在 GigaWorld-0 生成的数据上训练的 VLA 模型(如 GigaBrain-0)在真实世界中实现了强大的表现,显著提高了在物理机器人上的泛化能力和任务成功率,期间几乎未进行任何真实世界交互。

关键词

引用

@article{arxiv.2511.19861,
  title  = {GigaWorld-0: World Models as Data Engine to Empower Embodied AI},
  author = {GigaWorld Team and Angen Ye and Boyuan Wang and Chaojun Ni and Guan Huang and Guosheng Zhao and Haoyun Li and Jiagang Zhu and Kerui Li and Mengyuan Xu and Qiuping Deng and Siting Wang and Wenkang Qin and Xinze Chen and Xiaofeng Wang and Yankai Wang and Yu Cao and Yifan Chang and Yuan Xu and Yun Ye and Yang Wang and Yukun Zhou and Zhengyuan Zhang and Zhehao Dong and Zheng Zhu},
  journal= {arXiv preprint arXiv:2511.19861},
  year   = {2025}
}

备注

Project Page: https://giga-world-0.github.io/