基于深度期望 Sarsa 和非线性时序差分学习的收敛 NMPC 强化学习
系统与控制
2025-04-23 v2 机器人学
系统与控制
摘要
在本文中,我们提出了一种基于学习的非线性模型预测控制器 (NMPC),使用一种原创的强化学习 (RL) 方法来学习 NMPC 方案的最优权重,为此提出了两种方法。首先,控制器被用作深度期望 Sarsa 的当前动作-价值函数,其中通常由次级 NMPC 获得的后续动作-价值函数由一个神经网络 (NN) 近似。相对于现有方法,我们将 NMPC 学习参数的当前值添加到 NN 的输入中,使得网络能够近似动作-价值函数并稳定学习性能。此外,通过使用 NN,实时计算负担大约减半,而不影响闭环性能。其次,我们将梯度时序差分方法与参数化 NMPC 结合,作为期望 Sarsa RL 方法的函数逼近器,以克服在函数逼近中存在非线性时可能出现的参数发散和不稳定问题。仿真结果表明,所提出的方法能够收敛到局部最优解,且无稳定性问题。
引用
@article{arxiv.2502.04925,
title = {Convergent NMPC-based Reinforcement Learning Using Deep Expected Sarsa and Nonlinear Temporal Difference Learning},
author = {Amine Salaje and Thomas Chevet and Nicolas Langlois},
journal= {arXiv preprint arXiv:2502.04925},
year = {2025}
}