Q值加权回归:有限数据下的强化学习
机器学习
2021-02-16 v1
摘要
样本效率与离线设定下的性能已成为深度强化学习的重要挑战。我们提出Q值加权回归(QWR),一种在这些方面表现出色的简单RL算法。QWR是优势加权回归(AWR)的扩展,AWR是一种在连续控制任务上表现很好(包括离线设定)的离策略actor-critic算法,但样本效率低下且难以处理高维观测空间。我们对AWR进行了分析以解释其缺陷,并借此引出QWR。我们通过实验表明,QWR在连续与离散动作任务上均与SOTA算法相当。特别地,QWR在MuJoCo套件上取得了与SAC相当的结果,并且——使用同一组超参数——在一系列Atari游戏上取得了与高度调优的Rainbow实现相当的结果。我们还验证了QWR在离线RL设定下表现良好。
引用
@article{arxiv.2102.06782,
title = {Q-Value Weighted Regression: Reinforcement Learning with Limited Data},
author = {Piotr Kozakowski and Łukasz Kaiser and Henryk Michalewski and Afroz Mohiuddin and Katarzyna Kańska},
journal= {arXiv preprint arXiv:2102.06782},
year = {2021}
}