基于梯度的元强化学习中的课程设计
机器学习
2020-02-20 v1 人工智能
机器学习
摘要
基于梯度的元学习器,如模型无关元学习(MAML),在监督和强化学习设置中已展现出强大的少样本性能。然而,具体到元强化学习(meta-RL)的情形,我们可以证明基于梯度的元学习器对任务分布敏感。在错误的课程下,智能体会遭受元过拟合、浅层适应和适应不稳定的影响。在本工作中,我们首先指出基于梯度的元强化学习一些引人关注的失败案例,并表明任务分布会极大地影响算法输出、稳定性和性能。为解决该问题,我们利用近期关于域随机化文献的见解,提出元主动域随机化(meta-ADR),其为基于梯度的元强化学习学习任务课程,方式类似于 ADR 用于 sim2real 迁移。我们表明该方法在多种模拟运动与导航任务上诱导出更稳定的策略。我们评估了分布内与分布外泛化,并发现所学得的任务分布,即便在非结构化任务空间中,也极大改善了 MAML 的适应性能。最后,我们论证了元强化学习中更好基准测试的必要性,该基准应优先考量泛化而非单任务适应性能。
引用
@article{arxiv.2002.07956,
title = {Curriculum in Gradient-Based Meta-Reinforcement Learning},
author = {Bhairav Mehta and Tristan Deleu and Sharath Chandra Raparthy and Chris J. Pal and Liam Paull},
journal= {arXiv preprint arXiv:2002.07956},
year = {2020}
}
备注
11 pages, 10 figures