中文

L2Explorer:一个终身强化学习评估环境

机器学习 2022-03-16 v1 人工智能

摘要

尽管强化学习在机器人、游戏和其他复杂领域取得了突破性进展,但在将强化学习应用于关键应用空间中常见的演化式开放世界问题时,仍面临重大挑战。当暴露于训练数据分布之外的新任务时,强化学习方案的泛化能力往往较差,这引发了对持续学习算法的关注。与持续学习算法研究同步,还需要挑战性环境、精心设计的实验和指标来评估研究进展。我们针对后一需求,引入了一种使用终身学习探索器(Lifelong Learning Explorer, L2Explorer)的持续强化学习开发与评估框架;L2Explorer 是一个基于 Unity 的新的一人称 3D 探索环境,可连续重新配置以生成一系列任务及任务变体,并结构化为复杂且演化的评估课程。与具有随机化组件的程序生成世界不同,我们开发了一种系统方法来定义课程,以响应受控变化,并配备相应指标来评估迁移、性能恢复和数据效率。综上,L2Explorer 环境与评估方法为开发开放世界环境下的未来评估方法学以及严格评估终身学习方法提供了框架。

关键词

引用

@article{arxiv.2203.07454,
  title  = {L2Explorer: A Lifelong Reinforcement Learning Assessment Environment},
  author = {Erik C. Johnson and Eric Q. Nguyen and Blake Schreurs and Chigozie S. Ewulum and Chace Ashcraft and Neil M. Fendley and Megan M. Baker and Alexander New and Gautam K. Vallabha},
  journal= {arXiv preprint arXiv:2203.07454},
  year   = {2022}
}

备注

10 Pages submitted to AAAI AI for Open Worlds Symposium 2022