中文

样本高效的强化学习控制Koopman eNMPC

机器学习 2025-05-14 v2 最优化与控制

摘要

强化学习(RL)可用于调优数据驱动(经济)非线性模型预测控制器((e)NMPC)以实现特定控制任务的最优性能,通过优化动态模型或策略目标函数/约束中的参数,如状态边界。然而,RL的样本效率至关重要,为提高样本效率,我们将基于模型的RL算法与我们已发布的方法结合,该方法将Koopman(e)NMPC转化为自动可微策略。我们将方法应用于来自文献中连续搅拌罐反应器(CSTR)模型的eNMPC案例研究。该方法优于基准方法,即使用系统辨识构建的无进一步RL调优的数据驱动eNMPC,以及使用基于模型的RL训练的神经网络控制器,实现了卓越的控制性能和更高的样本效率。此外,利用关于系统动力学的部分先验知识通过物理信息学习进一步提高了样本效率。

关键词

引用

@article{arxiv.2503.18787,
  title  = {Sample-Efficient Reinforcement Learning of Koopman eNMPC},
  author = {Daniel Mayfrank and Mehmet Velioglu and Alexander Mitsos and Manuel Dahmen},
  journal= {arXiv preprint arXiv:2503.18787},
  year   = {2025}
}

备注

25 pages, 9 figures, 2 tables