连续参数化环境中深度强化学习课程学习的教师算法
机器学习
2019-10-17 v1 机器人学
机器学习
摘要
我们考虑教师算法如何使未知的深度强化学习(DRL)学生能够在广泛多样的环境中熟练掌握某项技能的问题。为此,我们研究教师算法如何学习生成学习课程,即顺序采样控制环境随机程序化生成的参数。由于教师最初不了解学生的能力,其关键挑战在于发现哪些环境是容易、困难或不可学习的,以及以何种顺序提出这些环境,以最大化在可学习环境上的学习效率。为实现这一目标,该问题被转化为一个替代的连续赌博机问题,其中教师采样环境以最大化学生的绝对学习进度。我们提出了一种用高斯混合模型(ALP-GMM)建模绝对学习进度的新算法。我们还适配了现有算法,并在DRL背景下提供了完整的研究。使用BipedalWalker环境的参数化变体,我们研究了它们为不同学习者(具身形态)个性化学习课程的效率、它们对可学习/不可学习环境比例的鲁棒性,以及它们对非线性和高维参数空间的可扩展性。视频和代码可在https://github.com/flowersteam/teachDeepRL获取。
引用
@article{arxiv.1910.07224,
title = {Teacher algorithms for curriculum learning of Deep RL in continuously parameterized environments},
author = {Rémy Portelas and Cédric Colas and Katja Hofmann and Pierre-Yves Oudeyer},
journal= {arXiv preprint arXiv:1910.07224},
year = {2019}
}
备注
Accepted at CoRL 2019