中文

Lamarckian平台:将进化强化学习的边界推进至异步商业游戏

机器学习 2022-09-22 v1 人工智能 神经与进化计算

摘要

尽管将进化计算融入强化学习已取得进展,但缺乏兼具可组合性与大规模并行能力的高性能平台,给异步商业游戏相关研究与应用带来不小困难。在此我们介绍Lamarckian——一个支持进化强化学习并可扩展至分布式计算资源的开源平台。为提升训练速度与数据效率,Lamarckian采用优化通信方法与异步进化强化学习工作流。为满足商业游戏与各类方法对异步接口的需求,Lamarckian量身定制了异步马尔可夫决策过程接口,并设计了具有解耦模块的面向对象软件架构。与state-of-the-art的RLlib相比,我们在多达6000个CPU核心的基准测试中实证展示了Lamarckian的独特优势:i) 在Google football游戏上运行PPO时,采样效率与训练速度均翻倍;ii) 在Pong游戏上运行PBT+PPO时,训练速度快13倍。此外,我们还给出两个用例:i) 如何将Lamarckian应用于生成行为多样的游戏AI;ii) 如何将Lamarckian应用于某异步商业游戏的游戏平衡测试。

关键词

引用

@article{arxiv.2209.10055,
  title  = {Lamarckian Platform: Pushing the Boundaries of Evolutionary Reinforcement Learning towards Asynchronous Commercial Games},
  author = {Hui Bai and Ruimin Shen and Yue Lin and Botian Xu and Ran Cheng},
  journal= {arXiv preprint arXiv:2209.10055},
  year   = {2022}
}