中文

利用习得技能先验加速强化学习

机器学习 2020-10-23 v1 人工智能 机器人学

摘要

智能体学习新任务时高度依赖先验经验,但多数现代强化学习(RL)方法仍从零开始学习每个任务。利用先验知识的一种途径是将先前任务习得的技能迁移至新任务。然而,随着先验经验增多,可迁移技能数量也随之增长,使下游学习中探索全部可用技能变得困难。直观上,并非所有技能都应以等概率被探索;例如当前状态信息可提示哪些技能值得探索。本文提出通过习得技能上的先验来实现该直觉。我们提出一种深度潜变量模型,从离线智能体经验中联合学习技能嵌入空间与技能先验。随后扩展常见最大熵 RL 方法,以利用技能先验引导下游学习。我们在复杂导航与机械臂操作任务上验证了所提方法 SPiRL(Skill-Prior RL),表明习得的技能先验对于从丰富数据集中有效迁移技能至关重要。视频与代码见 https://clvrai.com/spirl。

关键词

引用

@article{arxiv.2010.11944,
  title  = {Accelerating Reinforcement Learning with Learned Skill Priors},
  author = {Karl Pertsch and Youngwoon Lee and Joseph J. Lim},
  journal= {arXiv preprint arXiv:2010.11944},
  year   = {2020}
}

备注

4th Conference on Robot Learning (CoRL), 2020