中文

基于后悔值环境设计的演化课程

机器学习 2023-10-03 v3

摘要

训练具有通用能力的强化学习 (RL) 智能体仍是一项重大挑战。提升 RL 智能体鲁棒性的一个有前景的途径是使用课程。其中一类方法将环境设计构建为学生与教师之间的博弈,利用基于后悔值的objective产生处于学生智能体能力边界的环境实例(或关卡)。这些方法因其通用性而受益,在均衡处具有理论保证,但它们常难以在具有挑战性的设计空间中找到有效关卡。相比之下,演化方法试图逐步改变环境复杂度,从而实现潜在的开放式学习,但往往依赖领域特定的启发式方法与大量计算资源。在本文中,我们提出在原则性的、基于后悔值的课程中利用演化的力量。我们的方法称为通过编辑关卡对抗式复合复杂度 (ACCEL),旨在持续产生处于智能体能力边界的关卡,从而形成由简至难渐趋复杂的课程。ACCEL 保持了先前基于后悔值方法的理论优势,同时在多样化环境中取得了显著的实证增益。本文的交互版本可在 accelagent.github.io 获取。

关键词

引用

@article{arxiv.2203.01302,
  title  = {Evolving Curricula with Regret-Based Environment Design},
  author = {Jack Parker-Holder and Minqi Jiang and Michael Dennis and Mikayel Samvelyan and Jakob Foerster and Edward Grefenstette and Tim Rocktäschel},
  journal= {arXiv preprint arXiv:2203.01302},
  year   = {2023}
}

备注

First two authors contributed equally