从示范中自动生成策略梯度的课程
机器学习
2019-12-03 v1 人工智能
机器学习
摘要
在本文中,我们提出了一种改进训练智能体(使用强化学习)进行指令跟随过程的技术。我们开发了一种训练课程,该课程使用少量的专家示范,并以一种与人类学习执行复杂任务的方式之一相类似的方法来训练智能体,即从目标出发向后推导。我们在 BabyAI 平台上测试了我们的方法,并显示出与其 PPO(近端策略优化)基线相比,在其部分任务上样本效率有所提升。
引用
@article{arxiv.1912.00444,
title = {Automated curriculum generation for Policy Gradients from Demonstrations},
author = {Anirudh Srinivasan and Dzmitry Bahdanau and Maxime Chevalier-Boisvert and Yoshua Bengio},
journal= {arXiv preprint arXiv:1912.00444},
year = {2019}
}
备注
Accepted to Deep RL Workshop at NeurIPS 2019