受强化学习启发的阶段代价整形的模型预测控制
最优化与控制
2020-04-28 v2 系统与控制
系统与控制
动力系统
摘要
本工作对一种基于强化学习思想进行阶段代价整形的特定模型预测控制进行了次优性研究。该次优性研究的重点是推导在上述模型预测控制变体下的无限时域代价函数与相应无限时域值函数之间的量化关系。基础控制方案包含通常的稳定化约束,即由终端集与以局部 Lyapunov 函数形式的终端代价组成。阶段代价利用 Q-learning(一种特定的强化学习方法)的原理进行自适应调整。本工作以两个系统在大范围初始条件下的案例研究作结。
引用
@article{arxiv.1906.02580,
title = {Model predictive control with stage cost shaping inspired by reinforcement learning},
author = {Lukas Beckenbach and Pavel Osinenko and Stefan Streif},
journal= {arXiv preprint arXiv:1906.02580},
year = {2020}
}
备注
2 figures