通过自监督主动域随机化生成自动课程
机器学习
2020-10-28 v2 人工智能
机器人学
机器学习
摘要
目标导向的强化学习(RL)传统上考虑智能体与环境交互,向智能体施加与某目标完成度成比例的实数值奖励。由于通过提出目标来重用或生成新经验的便利性,目标导向RL在样本效率上已取得大幅提升。一种方法——自博弈(self-play)——允许智能体通过交替设定与完成目标来与自身“对弈”,从而创建学习课程,使智能体学会完成渐进更难的目标。然而,自博弈一直局限于目标课程学习或在单一环境中学习渐进更难的目标。近期关于机器人智能体的工作表明,在训练中改变环境(例如通过域随机化)可带来更鲁棒的迁移。因此,我们将自博弈框架扩展为联合学习目标与环境课程,从而得到一种通过自博弈学习最有益的域随机化策略的方法。我们的方法——自监督主动域随机化(SS-ADR)——生成耦合的目标-任务课程,其中智能体通过渐进更难的任务与环境变化学习。通过鼓励智能体尝试刚好超出其当前能力的任务,SS-ADR构建了域随机化课程,在各种sim2real迁移任务上取得了最先进的结果。我们的结果表明,将环境难度与每个环境中设定目标的难度共同演化的课程,在所测试的目标导向任务中提供了实际益处。
引用
@article{arxiv.2002.07911,
title = {Generating Automatic Curricula via Self-Supervised Active Domain Randomization},
author = {Sharath Chandra Raparthy and Bhairav Mehta and Florian Golemo and Liam Paull},
journal= {arXiv preprint arXiv:2002.07911},
year = {2020}
}