策略梯度对近线性二次型调节器收敛至全局最优策略
机器学习
2025-04-11 v5 最优化与控制
机器学习
摘要
决策者可获取部分信息的非线性控制系统在各类应用中十分普遍。作为研究此类非线性系统的一步,本文探讨了用于在近线性二次型调节器系统中寻找最优策略的强化学习方法。具体而言,我们考虑一个结合线性与非线性组件并由具有相同结构的策略所控制的动态系统。假设非线性组件由具有较小 Lipschitz 系数的核组成,我们刻画了代价函数的优化地形。尽管代价函数一般而言非凸,我们建立了其在全局最优器附近的局部强凸性与光滑性。此外,我们提出了一种初始化机制以利用这些性质。基于上述进展,我们设计了一种策略梯度算法,该算法保证以线性速率收敛至全局最优策略。
引用
@article{arxiv.2303.08431,
title = {Policy Gradient Converges to the Globally Optimal Policy for Nearly Linear-Quadratic Regulators},
author = {Yinbin Han and Meisam Razaviyayn and Renyuan Xu},
journal= {arXiv preprint arXiv:2303.08431},
year = {2025}
}
备注
34 pages