中文

基于技能的元强化学习

机器学习 2022-04-26 v1 人工智能

摘要

尽管深度强化学习方法在机器人学习中取得了令人印象深刻的成果,但其样本低效使得利用真实机器人系统学习复杂、长程行为变得不可行。为缓解该问题,元强化学习方法旨在通过学会学习来实现在新任务上的快速学习。然而,其应用一直局限于具有稠密奖励的短程任务。为实现长程行为的学习,近期工作探索了利用无奖励或任务标注的离线数据集形式的先验经验。虽然这些方法带来了样本效率的提升,但仍需与环境进行数百万次交互才能解决复杂任务。在本工作中,我们设计了一种能够在长程、稀疏奖励任务上进行元学习的方法,使我们能以数量级更少的环境交互解决未见目标任务。我们的核心思想是在元学习期间利用从离线数据集中提取的先验经验。具体而言,我们提出:(1)从离线数据集中提取可复用技能与技能先验;(2)元训练一个高层策略,学习将已学技能高效组合为长程行为;(3)快速适配元训练策略以解决未见目标任务。在导航与操控中的连续控制任务上的实验结果表明,所提方法通过结合元学习与离线数据集使用的优势,能够高效解决长程新目标任务,而RL、元RL与多任务RL中的既有方法需多得多的环境交互才能解决这些任务。

关键词

引用

@article{arxiv.2204.11828,
  title  = {Skill-based Meta-Reinforcement Learning},
  author = {Taewook Nam and Shao-Hua Sun and Karl Pertsch and Sung Ju Hwang and Joseph J Lim},
  journal= {arXiv preprint arXiv:2204.11828},
  year   = {2022}
}

备注

ICLR 2022. Project page at https://namsan96.github.io/SiMPL