中文

Autoverse:用于学习鲁棒嵌入式智能体的可进化游戏语言

人工智能 2024-08-07 v2

摘要

我们介绍 Autoverse,这是一种可进化、领域特定的语言,用于单人 2D 网格-based 游戏,展示其作为 Open-Ended Learning(OEL)算法可扩展训练基地的用途。Autoverse 使用类胞胞自动机的 rewrite 规则描述游戏机制,允许其表达各种游戏环境(如迷宫、地下城、Sokoban 解谜),这些是强化学习(RL)智能体的流行测试平台。每个 rewrite 规则可表示为一系列简单的卷积,允许环境在 GPU 上并行化,从而大幅加速 RL 训练。使用 Autoverse,我们提出通过模仿学习从搜索中启动开放式学习的方法。具体而言,我们首先进化 Autoverse 环境(其规则和初始拓扑结构),以最大化贪心树搜索发现新最佳解所需的迭代次数,产生一系列日益复杂的环境和 playtraces。我们随后通过模仿学习将这些专家 playtraces 蒸馏为基于神经网络的策略。最后,我们将所学策略用作开放式 RL 的起点,其中持续进化新的训练环境以最大化 RL 玩家智能体的价值函数误差(即其后悔或生成环境可学习性的 proxy),结果表明这种方法提高了所得玩家智能体的性能和通用性。

关键词

引用

@article{arxiv.2407.04221,
  title  = {Autoverse: An Evolvable Game Language for Learning Robust Embodied Agents},
  author = {Sam Earle and Julian Togelius},
  journal= {arXiv preprint arXiv:2407.04221},
  year   = {2024}
}

备注

9 pages, 4 figures