OPAL:用于加速离线强化学习的离线原语发现
机器学习
2021-05-06 v3
摘要
强化学习(RL)已在多种在线环境中取得了令人印象深刻的性能,在这些环境中智能体查询环境与转移及奖励的能力实际上不受限制。然而,在许多实际应用中,情况恰恰相反:智能体可能获得大量无向的离线经验数据,而访问在线环境则受到严重限制。在本文中,我们关注这一离线设定。我们的核心见解是,当面对由多种行为组成的离线数据时,利用该数据的有效方式是在将这些原语用于下游任务学习之前,提取一个由反复出现且时间扩展的原语行为构成的连续空间。以这种方式提取的原语有两个作用:它们划定了数据所支持的行为与不支持的行为之间的界限,使其有助于避免离线RL中的分布偏移;并且它们提供了一种时间抽象程度,从而减少了有效时域,在理论上带来更好的学习,并在实践中改进了离线RL。除了有益于离线策略优化外,我们表明以这种方式进行离线原语学习还可被用于改进少样本模仿学习以及在多种基准领域中的在线RL探索与迁移。可视化内容可在 https://sites.google.com/view/opal-iclr 查看。
引用
@article{arxiv.2010.13611,
title = {OPAL: Offline Primitive Discovery for Accelerating Offline Reinforcement Learning},
author = {Anurag Ajay and Aviral Kumar and Pulkit Agrawal and Sergey Levine and Ofir Nachum},
journal= {arXiv preprint arXiv:2010.13611},
year = {2021}
}
备注
https://sites.google.com/view/opal-iclr