中文

Genie:生成式交互环境

机器学习 2024-02-26 v1 人工智能 计算机视觉与模式识别

摘要

我们推出了 Genie,这是首个从无标签互联网视频中以无监督方式训练而成的生成式交互环境。该模型可通过文本、合成图像、照片甚至草图描述,被提示生成 endless variety 的动作可控虚拟世界。Genie 拥有 110 亿参数,可被视为基础世界模型(foundation world model)。它由时空视频分词器、自回归动力学模型以及一个简单且可扩展的潜在动作模型组成。尽管训练过程中没有任何真实动作标签或世界模型文献中常见的其他特定领域要求,Genie 使用户能够以逐帧方式在生成的环境中进行交互。此外,由此学到的潜在动作空间促进了智能体模仿未见视频中的行为,为未来训练通用智能体开辟了道路。

关键词

引用

@article{arxiv.2402.15391,
  title  = {Genie: Generative Interactive Environments},
  author = {Jake Bruce and Michael Dennis and Ashley Edwards and Jack Parker-Holder and Yuge Shi and Edward Hughes and Matthew Lai and Aditi Mavalankar and Richie Steigerwald and Chris Apps and Yusuf Aytar and Sarah Bechtle and Feryal Behbahani and Stephanie Chan and Nicolas Heess and Lucy Gonzalez and Simon Osindero and Sherjil Ozair and Scott Reed and Jingwei Zhang and Konrad Zolna and Jeff Clune and Nando de Freitas and Satinder Singh and Tim Rocktäschel},
  journal= {arXiv preprint arXiv:2402.15391},
  year   = {2024}
}

备注

https://sites.google.com/corp/view/genie-2024/