中文

关于连续动作空间中策略镜像上升的隐藏偏差

机器学习 2022-02-01 v2 人工智能 最优化与控制

摘要

我们关注连续动作空间上强化学习的参数化策略搜索。通常假设与策略相关的得分函数有界,但这即使对高斯策略也不成立。为妥善处理此问题,必须引入探索容差参数来量化其有界的区域。这样做会产生一个持续性偏差,出现在期望策略梯度范数的衰减率中,该衰减率与动作空间半径成反比。为缓解此隐藏偏差,可使用重尾策略参数化,其具有有界得分函数,但这样做会导致算法更新的不稳定性。为解决这些问题,本工作中我们研究重尾参数化下策略梯度算法的收敛性,并提议通过镜像上升型更新与梯度跟踪相结合来稳定之。我们的主要理论贡献是确立了该方案在常数步长与批大小下收敛,而先前工作分别要求这些参数收缩至零或增长至无穷。实验上,相较于标准基准,该重尾策略参数化方案在多种设置下获得了改进的奖励累积。

关键词

引用

@article{arxiv.2201.12332,
  title  = {On the Hidden Biases of Policy Mirror Ascent in Continuous Action Spaces},
  author = {Amrit Singh Bedi and Souradip Chakraborty and Anjaly Parayil and Brian Sadler and Pratap Tokekar and Alec Koppel},
  journal= {arXiv preprint arXiv:2201.12332},
  year   = {2022}
}