中文

通过减少自举误差稳定离策略 Q-Learning

机器学习 2019-11-26 v2 机器学习

摘要

离策略强化学习旨在利用先前策略收集的经验以实现样本高效学习。然而在实践中,常用的基于 Q-learning 和 actor-critic 方法的离策略近似动态规划方法对数据分布高度敏感,且在不收集额外同策略数据的情况下只能取得有限进展。作为迈向更鲁棒离策略算法的一步,我们研究这样一种设定:离策略经验固定且不再与环境进一步交互。我们将自举误差识别为当前方法不稳定的关键来源。自举误差源于从训练数据分布之外的动作进行自举,并通过 Bellman 备份算子累积。我们从理论上分析了自举误差,并展示了如何通过在备份中谨慎约束动作选择来缓解它。基于我们的分析,我们提出了一种实用算法——自举误差累积缩减(BEAR)。我们证明了 BEAR 能够在一系列连续控制任务上从不同离策略分布(包括随机和次优演示)中鲁棒地学习。

关键词

引用

@article{arxiv.1906.00949,
  title  = {Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction},
  author = {Aviral Kumar and Justin Fu and George Tucker and Sergey Levine},
  journal= {arXiv preprint arXiv:1906.00949},
  year   = {2019}
}

备注

Accepted at NeurIPS 2019; Project Website: https://sites.google.com/view/bear-off-policyrl