中文

ReLU控制器在线性二次调节问题中的策略梯度全局收敛性

最优化与控制 2026-04-27 v1 系统与控制 系统与控制

摘要

我们研究基于模型的策略梯度方法在确定性、标量、折扣线性-二次调节问题(LQR)中使用ReLU控制器的收敛性。虽然最优LQR控制器为线性函数,但神经网络参数化会导致冗余的非凸权重空间,产生可能呈非对称分段线性控制器。我们表明,这一结构可以通过在正半轴和负半轴上施加的两个有效增益来进行精确分析。在合适的随机初始化、足够宽度和较小步长下,基于模型的策略梯度保持稳定,代价函数按几何级数下降,并以高概率将有效增益驱动到唯一的标量LQR增益。

关键词

引用

@article{arxiv.2604.22138,
  title  = {Global Convergence of Policy Gradient Methods for ReLU Controllers in Linear Quadratic Regulation},
  author = {Jhojan A. Rodriguez-Gil and César A. Uribe},
  journal= {arXiv preprint arXiv:2604.22138},
  year   = {2026}
}