谨慎策略规划:在强化学习单调策略改进中利用 KL 正则化
机器学习
2022-01-19 v3 人工智能
摘要
在本文中,我们提出谨慎策略规划(CPP),一种新颖的基于价值的强化学习(RL)算法,可确保学习过程中的单调策略改进。基于熵正则化 RL 的本质,我们推导出一种新颖的熵正则化感知的策略改进下界,其仅需估计期望策略优势函数。CPP 利用该下界作为调整策略更新程度的准则,以缓解策略振荡。与多数偏重理论的同类算法不同,我们还提出一种新颖的插值方案,使 CPP 在高层控制问题中具有更好的可扩展性。我们证明,所提算法可在教学性经典控制问题与具挑战性的高维 Atari 游戏中权衡性能与稳定性。
引用
@article{arxiv.2107.05798,
title = {Cautious Policy Programming: Exploiting KL Regularization in Monotonic Policy Improvement for Reinforcement Learning},
author = {Lingwei Zhu and Toshinori Kitamura and Takamitsu Matsubara},
journal= {arXiv preprint arXiv:2107.05798},
year = {2022}
}
备注
15 pages. arXiv admin note: text overlap with arXiv:2008.10806