有限时域内含噪声线性二次调节器的策略梯度方法
机器学习
2021-06-25 v2 统计金融
摘要
我们探索用于求解线性二次调节器(LQR)问题中最优策略的强化学习方法。具体而言,我们考虑在参数已知与未知情形下策略梯度方法的收敛性。在弱假设下,我们针对有限时间域与随机状态动态这一设定,给出了该方法的全局线性收敛保证。为处理带约束的问题,我们还建立了一种投影策略梯度方法的收敛性。我们用两个例子说明了该算法的性能。第一个例子是资产持仓的最优清算。我们展示了在假设底层动态模型以及直接将方法应用于数据这两种情形下的结果。经验证据表明,策略梯度方法能够学习包含LQR框架的更广泛随机系统类的全局最优解,并且与基于模型的方法相比,其对模型误设定更具鲁棒性。第二个例子是一个高维设定下使用合成数据的LQR系统。
引用
@article{arxiv.2011.10300,
title = {Policy Gradient Methods for the Noisy Linear Quadratic Regulator over a Finite Horizon},
author = {Ben Hambly and Renyuan Xu and Huining Yang},
journal= {arXiv preprint arXiv:2011.10300},
year = {2021}
}
备注
49 pages, 9 figures