中文

基于优势加权的离线元强化学习

机器学习 2021-07-22 v3 人工智能 机器学习

摘要

本文引入了离线元强化学习(offline meta-RL)问题设定并提出了在该设定下表现良好的算法。离线元-RL类似于广泛成功的监督学习策略:在大量固定的、预先收集的数据(可能来自各种任务)上预训练模型,然后用相对较少的数据微调模型到新任务。即在离线元-RL中,我们在来自若干任务的固定、预收集数据上进行元训练,以便用来自新任务的极少量(少于5条轨迹)数据适应新任务。由于离线的性质,离线元-RL算法可以利用可用的最大可能训练数据池,并消除元训练期间潜在不安全或昂贵的数据收集。该设定继承了离线RL的挑战,但与之显著不同,因为离线RL通常不考虑 a) 向新任务的迁移或 b) 测试任务的有限数据,而这两者都是我们在离线元-RL中面临的。针对离线元-RL设定,我们提出了带优势加权的元演员评论家(MACAW),一种基于优化的元学习算法,其对元训练的内循环和外循环均使用简单的监督回归目标。在常见元-RL基准的离线变体上,我们经验性地发现该方法实现了完全的离线元强化学习,并相比先前方法取得了显著增益。

关键词

引用

@article{arxiv.2008.06043,
  title  = {Offline Meta-Reinforcement Learning with Advantage Weighting},
  author = {Eric Mitchell and Rafael Rafailov and Xue Bin Peng and Sergey Levine and Chelsea Finn},
  journal= {arXiv preprint arXiv:2008.06043},
  year   = {2021}
}

备注

ICML 2021; for code & project info, see http://sites.google.com/view/macaw-metarl