用于降低方差强化学习的控制正则化
机器学习
2019-05-15 v1 系统与控制
机器学习
摘要
处理高方差是无模型强化学习(RL)中的重大挑战。现有方法不可靠,使用不同初始化/随机种子时各次运行间表现出高绩效方差。聚焦于连续控制中出现的问题,我们提出一种函数正则化方法来增强无模型 RL。具体而言,我们正则化深度策略的行为以类似于策略先验,即在函数空间中正则化。我们展示了函数正则化产生偏差-方差权衡,并提出了一种自适应调参策略来优化该权衡。当策略先验具有控制论稳定性保证时,我们进一步证明该正则化在整个学习过程中近似保持那些稳定性保证。我们在一系列设定上实证验证了我们的方法,并展示了相比单独深度 RL 显著降低了方差、保证了动态稳定性且学习更高效。
引用
@article{arxiv.1905.05380,
title = {Control Regularization for Reduced Variance Reinforcement Learning},
author = {Richard Cheng and Abhinav Verma and Gabor Orosz and Swarat Chaudhuri and Yisong Yue and Joel W. Burdick},
journal= {arXiv preprint arXiv:1905.05380},
year = {2019}
}
备注
Appearing in ICML 2019