多plicative 噪声下熵正则化线性-二次控制的策略梯度全局收敛性
系统与控制
2025-12-02 v4 人工智能
系统与控制
摘要
强化学习(RL)已成为针对动态环境中序列决策的强大框架,尤其适用于系统参数未知的情况下。本文针对基于熵正则化的线性-二次(LQ)控制问题(在乘法噪声下、无限时间轴上)进行 RL 控制研究。首先,我们将正则化策略梯度(RPG)算法适用于随机最优控制场景,证明尽管问题非凸,RPG 在梯度支配条件和几乎光滑性条件下仍可全局收敛。其次,基于零阶优化方法,我们引入一种新型无模型 RL 算法:基于样本的正则化策略梯度(SB-RPG)。SB-RPG 无需系统参数知识,却仍保持强大的全局收敛理论保证。我们的模型利用熵正则化来解决 RL 中固有的探索与开发权衡。数值仿真验证了理论结果,展示了 SB-RPG 在未知参数环境中的高效性。
引用
@article{arxiv.2510.02896,
title = {Global Convergence of Policy Gradient for Entropy Regularized Linear-Quadratic Control with Multiplicative Noise},
author = {Gabriel Diaz and Lucky Li and Wenhao Zhang},
journal= {arXiv preprint arXiv:2510.02896},
year = {2025}
}
备注
The authors found that article contains some theoretical errors and decided to withdraw from arxiv