用于稳定离线强化学习的投影离屏 Q-学习(POP-QL)
机器学习
2023-11-28 v1
摘要
离屏强化学习(RL)的一个关键问题是数据集与所学策略所访问的状态-动作分布之间的不匹配,或称分布偏移。该问题在完全离线设定下被加剧。纠正此偏移的主要途径是通过重要性采样,而这会导致高方差梯度。其他方法,如保守性或行为正则化,以性能为代价对策略进行正则化。在本文中,我们提出一种用于稳定离屏 Q-学习的新途径。我们的方法,投影离屏 Q-学习(POP-QL),是一种新颖的 actor-critic 算法,它同时重新加权离屏样本并约束策略,以防止发散并降低值近似误差。在我们的实验中,POP-QL 不仅在标准基准上展现出有竞争力的性能,而且在数据收集策略明显次优的任务中优于对比方法。
引用
@article{arxiv.2311.14885,
title = {Projected Off-Policy Q-Learning (POP-QL) for Stabilizing Offline Reinforcement Learning},
author = {Melrose Roderick and Gaurav Manek and Felix Berkenkamp and J. Zico Kolter},
journal= {arXiv preprint arXiv:2311.14885},
year = {2023}
}
备注
10 pages