中文

Pandora:面向通用世界模型的探索,融合自然语言动作与视频状态

计算机视觉与模式识别 2024-06-17 v1 人工智能 计算与语言

摘要

世界模型通过模拟世界对不同动作的响应,来预测未来状态。它们促进了交互式内容创建,为基于 grounding 的长期推理提供了基础。当前的基础模型未能完全满足通用世界模型的能力:大型语言模型(LLM)受限于其对语言模态的依赖以及对物理世界理解有限,而视频模型缺乏对世界仿真的交互式动作控制。本文通过引入 Pandora,一种混合自回归-扩散模型,推进构建通用世界模型的研究,该模型通过生成视频来模拟世界状态,并允许使用自由文本动作实现实时控制。Pandora 通过大规模预训练和指令微调,实现了领域通用性、视频一致性和可控性。关键在于,Pandora 通过集成预训练的 LLM(7B)和预训练视频模型,无需从头训练即可实现,仅需额外的轻量级微调。我们展示了 Pandora 在多样化领域(室内/户外、自然/城市、人类/机器人、2D/3D 等)的广泛输出。结果表明,通过更大规模的训练,构建更强大的通用世界模型具有巨大的潜力。

关键词

引用

@article{arxiv.2406.09455,
  title  = {Pandora: Towards General World Model with Natural Language Actions and Video States},
  author = {Jiannan Xiang and Guangyi Liu and Yi Gu and Qiyue Gao and Yuting Ning and Yuheng Zha and Zeyu Feng and Tianhua Tao and Shibo Hao and Yemin Shi and Zhengzhong Liu and Eric P. Xing and Zhiting Hu},
  journal= {arXiv preprint arXiv:2406.09455},
  year   = {2024}
}

备注

Website: https://world-model.maitrix.org/