基于策略梯度的无模型最优 LQG 控制与概率风险约束
系统与控制
2024-11-11 v2 系统与控制
摘要
本文研究一种无模型最优控制设计,利用输入输出数据在概率风险或机会约束下,最小化状态和控制作用的无穷时域平均期望二次代价。具体而言,我们考虑线性时不变系统,并在线性状态反馈控制类中设计最优控制器。我们开发了三种不同的基于策略梯度(PG)的算法:自然策略梯度(NPG)、Gauss-Newton 策略梯度(GNPG)和深度确定性策略梯度(DDPG),并通过数值仿真将它们与最优风险中性线性二次型调节器(LQR)和基于场景的模型预测控制(MPC)技术进行了比较。数值比较了所有算法的收敛性质和精度。我们还在已知模型场景下建立了 NPG 和 GNPG 算法的解析收敛性质,而未知模型场景下的收敛证明是我们正在进行的工作的一部分。
引用
@article{arxiv.2403.16767,
title = {Policy Gradient-based Model Free Optimal LQG Control with a Probabilistic Risk Constraint},
author = {Arunava Naha and Subhrakanti Dey},
journal= {arXiv preprint arXiv:2403.16767},
year = {2024}
}
备注
Submitted to IEEE ECC2025