确定性策略梯度中的拟牛顿迭代
机器学习
2022-03-29 v1 系统与控制
系统与控制
摘要
本文提出一种针对确定性策略性能的 Hessian 的无模型近似,以用于基于策略参数上拟牛顿步的强化学习之中。我们证明该近似 Hessian 在最优策略处收敛于精确 Hessian,并且只要策略参数化足够丰富,便允许学习中的超线性收敛。自然策略梯度方法可被解释为所提方法的一个特例。我们在一个简单线性情形中解析地验证了该表述,并在一个非线性例子中将所提方法的收敛性与自然策略梯度进行比较。
引用
@article{arxiv.2203.13854,
title = {Quasi-Newton Iteration in Deterministic Policy Gradient},
author = {Arash Bahari Kordabad and Hossein Nejatbakhsh Esfahani and Wenqi Cai and Sebastien Gros},
journal= {arXiv preprint arXiv:2203.13854},
year = {2022}
}
备注
This paper has been accepted to 2022 American Control Conference (ACC). 6 pages