中文

Eden:一种用于繁荣强化学习算法的统一环境框架

机器学习 2021-09-07 v1 人工智能

摘要

随着 AlphaGo 击败顶级人类玩家,强化学习(RL)算法已逐渐成为构建更强人工智能(AI)的基础代码。RL 算法设计首先需要适应特定环境,因此所设计的环境引导了 RL 算法的快速而深入的发展。然而,现有环境可分为真实世界游戏与定制玩具环境,存在明显缺陷。对于真实世界游戏,其是为人类娱乐而设计,对大多数 RL 研究者而言过于困难。对于定制玩具环境,缺乏被广泛接受的所有 RL 算法的统一评估标准。因此,我们引入了首个面向用户的虚拟 RL 环境框架。在该框架中,环境可轻松配置以实现主流研究中各类 RL 任务。随后所有主流最先进(SOTA)RL 算法均可便捷地评估与比较。因此,我们的贡献主要包括以下方面:1. 面向所有分类 SOTA RL 算法的单一配置环境;2. 多于一类 RL 算法的组合环境;3. 各类 RL 算法的评估标准。借助这些努力,提供了一种培育具备多种任务通用能力之 AI 的可能性,或许将开启 AI 的新篇章。

关键词

引用

@article{arxiv.2109.01768,
  title  = {Eden: A Unified Environment Framework for Booming Reinforcement Learning Algorithms},
  author = {Ruizhi Chen and Xiaoyu Wu and Yansong Pan and Kaizhao Yuan and Ling Li and TianYun Ma and JiYuan Liang and Rui Zhang and Kai Wang and Chen Zhang and Shaohui Peng and Xishan Zhang and Zidong Du and Qi Guo and Yunji Chen},
  journal= {arXiv preprint arXiv:2109.01768},
  year   = {2021}
}

备注

19 pages,16 figures