TeachMyAgent:深度强化学习中自动课程学习的基准
机器学习
2021-06-10 v2
摘要
训练能够泛化到多个任务的自主智能体是深度强化学习(DRL)研究的关键目标。在改进 DRL 算法本身的同时,自动课程学习(ACL)研究教师算法如何通过根据 DRL 智能体不断进化的能力调整任务选择来更高效地训练它们。尽管存在多个标准基准用于比较 DRL 智能体,目前尚无针对 ACL 算法的此类基准。因此,比较现有方法十分困难,因为不同论文间太多实验参数存在差异。在本文中,我们辨识出 ACL 算法面临的若干关键挑战。基于此,我们提出 TeachMyAgent(TA),一个利用程序化任务生成的现有 ACL 算法基准。它包括 1)使用程序化 Box2D 双足步行器环境变体的挑战专用单元测试,以及 2)结合多数 ACL 挑战的新型程序化 Parkour 环境,使其成为全局性能评估的理想选择。我们随后使用 TeachMyAgent 对具代表性的现有方法进行比较研究,展示了一些不使用专家知识的 ACL 算法的竞争力。我们还表明 Parkour 环境仍是一个开放问题。我们在 https://github.com/flowersteam/TeachMyAgent 的 Python 包中开源了我们的环境、所有被研究的 ACL 算法(收集自开源代码或重新实现)以及 DRL 学生。
引用
@article{arxiv.2103.09815,
title = {TeachMyAgent: a Benchmark for Automatic Curriculum Learning in Deep RL},
author = {Clément Romac and Rémy Portelas and Katja Hofmann and Pierre-Yves Oudeyer},
journal= {arXiv preprint arXiv:2103.09815},
year = {2021}
}