中文

基于MPC的强化学习及其在电池储能经济问题中的应用

机器学习 2021-04-07 v1 系统与控制 系统与控制

摘要

在本文中,我们关注具有纯经济成本的最优控制问题,这类问题的最优策略通常具有(近似)bang-bang 结构。我们聚焦于基于模型预测控制(MPC)的策略近似,并利用确定性策略梯度方法来优化在存在未建模随机性或模型误差情况下的 MPC 闭环性能。当策略具有(近似)bang-bang 结构时,我们观察到策略梯度方法难以在策略参数上产生有意义的更新步长。为解决此问题,我们提出一种基于内点法的同伦策略,在学习过程中对策略进行松弛。我们研究了一个特定的知名电池储能问题,并表明所提方法相比经典策略梯度方法实现了更均匀且更快的学习。

关键词

引用

@article{arxiv.2104.02411,
  title  = {MPC-based Reinforcement Learning for Economic Problems with Application to Battery Storage},
  author = {Arash Bahari Kordabad and Wenqi Cai and Sebastien Gros},
  journal= {arXiv preprint arXiv:2104.02411},
  year   = {2021}
}

备注

This paper has been accepted to ECC2021. 6 pages