中文

通过Bellman误差的梯度流连接连续时间LQR与强化学习

系统与控制 2026-04-17 v2 系统与控制

摘要

在本文中,我们提出了一种通过常微分方程计算无限时间线性二次型调节器(LQR)问题最优反馈增益的新方法。我们引入了一种新的连续时间Bellman误差,它由Hamilton-Jacobi-Bellman(HJB)方程导出,用于量化稳定化策略的次优性,并以反馈增益为参数进行参数化。我们分析了其性质,包括有效域、光滑性、强制性,并证明了在稳定区域内存在唯一的驻点。此外,我们推导了Bellman误差的闭式梯度表达式,它诱导了一个梯度流。该梯度流收敛到最优反馈,并生成一条唯一轨迹,该轨迹仅包含稳定化反馈策略。此外,这项工作通过将代数Riccati方程(ARE)的次最优性重新定义为Bellman误差、采用与状态无关的表述以及利用Lyapunov方程来克服无限时间挑战,推进了LQR理论与强化学习(RL)之间的有趣联系。我们在仿真中验证了我们的方法,并将其与最先进方法进行了比较。

关键词

引用

@article{arxiv.2506.09685,
  title  = {Bridging Continuous-time LQR and Reinforcement Learning via Gradient Flow of the Bellman Error},
  author = {Armin Gießler and Albertus Johannes Malan and Sören Hohmann},
  journal= {arXiv preprint arXiv:2506.09685},
  year   = {2026}
}

备注

submitted to Conference on Decision and Control