中文

WorldGPT:赋能LLM作为多模态世界模型

人工智能 2024-10-01 v2 多媒体

摘要

世界模型正逐渐被应用于各个领域,从基本的环境模拟到复杂的场景构建。然而,现有模型主要基于特定领域的状态和动作进行训练,并且局限于单模态状态表示。在本文中,我们介绍了WorldGPT,一个基于多模态大语言模型(MLLM)构建的通才世界模型。WorldGPT通过分析跨多个领域的数百万视频来理解世界动态。为了进一步增强WorldGPT在专门场景和长期任务中的能力,我们将其与一种新颖的认知架构集成,该架构结合了记忆卸载、知识检索和上下文反思。在评估方面,我们构建了WorldNet,一个包含各种真实生活场景的多模态状态转换预测基准。在WorldNet上进行评估直接证明了WorldGPT准确建模状态转换模式的能力,证实了其在理解和预测复杂场景动态方面的有效性。我们进一步探索了WorldGPT作为世界模拟器的新兴潜力,通过高效合成多模态指令实例来帮助多模态智能体泛化到不熟悉的领域,这些实例被证明与用于微调的真实数据一样可靠。项目可在\url{https://github.com/DCDmllm/WorldGPT}获取。

关键词

引用

@article{arxiv.2404.18202,
  title  = {WorldGPT: Empowering LLM as Multimodal World Model},
  author = {Zhiqi Ge and Hongzhe Huang and Mingze Zhou and Juncheng Li and Guoming Wang and Siliang Tang and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2404.18202},
  year   = {2024}
}

备注

update v2