中文

在可扩展世界模型内部训练智能体

人工智能 2025-09-30 v1 机器学习 机器人学 机器学习

摘要

世界模型从视频中学习通用知识并在想象中模拟经验以训练行为,为智能体提供了一条通向智能的路径。然而,先前的世界模型无法准确预测复杂环境中的物体交互。我们引入了Dreamer 4,一个可扩展的智能体,通过在快速且准确的世界模型内部利用强化学习来学习求解控制任务。在复杂的视频游戏Minecraft中,世界模型准确预测物体交互和游戏机制,优于先前世界模型的巨大差距。该世界模型通过捷径强制目标和高效的Transformer架构在单个GPU上实现实时交互推理。此外,世界模型仅从少量数据中学习通用动作条件化,使其能够从多样化的无标注视频中提取大部分知识。我们提出了仅从离线数据中获取Minecraft中钻石的挑战,这与机器人学等实际应用一致,在这些应用中从环境交互学习可能是不安全且缓慢的。该任务需要从原始像素中选择超过20,000个鼠标和键盘动作序列。通过在想象中学习行为,Dreamer 4是第一个仅从离线数据中(无需环境交互)获取Minecraft中钻石的智能体。我们的工作为想象训练提供了一个可扩展的方案,标志着通向智能体的一步。

关键词

引用

@article{arxiv.2509.24527,
  title  = {Training Agents Inside of Scalable World Models},
  author = {Danijar Hafner and Wilson Yan and Timothy Lillicrap},
  journal= {arXiv preprint arXiv:2509.24527},
  year   = {2025}
}

备注

Website: https://danijar.com/dreamer4/