EMaQ:用于简洁而高效的离线与在线强化学习的期望最大Q学习算子
机器学习
2021-01-15 v2 机器学习
摘要
离屏强化学习(off-policy reinforcement learning)有望通过利用过往经验实现决策策略的样本高效学习。然而,在离线RL设定下——仅提供固定的交互集合且不允许进一步交互——已表明标准离屏RL方法会显著表现不佳。近期提出的方法通常旨在通过约束所学策略保持接近给定的交互数据集来解决这一缺陷。在本工作中,我们仔细研究BCQ(一种先前的离线RL方法)的一个重要简化,其去除了一种启发式设计选择,并自然地将提取的策略限制为恰好保持在给定行为策略的支持集内。重要的是,与其最初的理论考量相反,我们通过引入一种新颖的备份算子——期望最大Q学习(Expected-Max Q-Learning, EMaQ)——推导出这一简化算法,该算子与所得的实际算法关系更为紧密。具体而言,除分布支持集外,EMaQ显式考虑样本数量与提议分布,使我们能够推导新的次优性界,其可作为离线RL问题复杂度的新度量。在离线RL设定下——本工作的主要焦点——EMaQ在D4RL基准上匹配并超越了先前的state-of-the-art。在线RL设定下,我们展示EMaQ与Soft Actor Critic具有竞争力。我们实证发现的关键贡献在于展示了用于估计行为策略的谨慎生成模型设计的重要性,以及离线RL问题的一个直观复杂度概念。凭借其简单解释和更少的可变部分(例如无显式表示策略的函数逼近器),EMaQ作为一个强大且易于实现的基线服务于未来工作。
引用
@article{arxiv.2007.11091,
title = {EMaQ: Expected-Max Q-Learning Operator for Simple Yet Effective Offline and Online RL},
author = {Seyed Kamyar Seyed Ghasemipour and Dale Schuurmans and Shixiang Shane Gu},
journal= {arXiv preprint arXiv:2007.11091},
year = {2021}
}