中文

元自动课程学习

机器学习 2021-09-02 v3 人工智能

摘要

深度强化学习(DRL)社区的一个主要挑战是训练能够将其控制策略泛化到训练期间从未见过情形的智能体。在多样化任务上训练已被认为是良好泛化的关键要素,这推动研究者使用由复杂连续参数空间控制的丰富程序化任务生成系统。在此类复杂任务空间中,依赖某种形式的自动课程学习(ACL)来使任务采样分布适应给定学习智能体至关重要,而非随机采样任务,因为许多任务可能最终过于简单或不可行。由于很难获得关于此类任务空间的先验知识,许多ACL算法探索任务空间以随时间检测进展利基,这是一个昂贵的白板过程,需要对每个新学习智能体执行,尽管它们能力轮廓可能相似。为解决此限制,我们引入元ACL(Meta-ACL)的概念,并在黑盒RL学习器的背景下将其形式化,即寻求将课程生成泛化到(未知)学习器分布的算法。本工作中,我们提出AGAIN,作为元ACL的首次实例化,并在多个模拟环境(包括具有不同形态学习器的程序化生成跑酷环境)中展示了其相对于经典ACL在课程生成上的优势。视频和代码见 https://sites.google.com/view/meta-acl 。

关键词

引用

@article{arxiv.2011.08463,
  title  = {Meta Automatic Curriculum Learning},
  author = {Rémy Portelas and Clément Romac and Katja Hofmann and Pierre-Yves Oudeyer},
  journal= {arXiv preprint arXiv:2011.08463},
  year   = {2021}
}

备注

This paper extends and generalizes work in arXiv:2004.03168