中文

基于模型预测控制引导的强化学习用于隐式平衡

系统与控制 2025-10-07 v1 人工智能 系统与控制

摘要

在欧洲,盈利驱动的平衡责任方可在实际时间内偏离其日前预测,以帮助电网运营商维持供需平衡。模型预测控制(MPC)策略试图利用这些隐式平衡策略捕捉套利机会,但未能准确捕捉欧洲失衡市场价格形成过程,且面临高计算成本。模型无关强化学习(RL)方法执行速度快,但需要大量数据进行训练,通常依赖实时和历史数据进行决策。本文提出一种MPC引导的RL方法,结合MPC和RL的互补优势。该方法能够有效地将预测信息纳入决策过程中(如MPC所做),同时保持RL的快速推理能力。本文使用2023年比利时平衡数据,对所提方法在隐式平衡电池控制问题上的性能进行评估。首先,我们从多个角度分析了单独的领先状态RL和MPC方法的性能,以凸显其各自的优势和局限性。接着,我们表明相对于单独的RL和MPC方法,所提MPC引导的RL方法可实现16.15%和54.36%的套利收益增益。

引用

@article{arxiv.2510.04868,
  title  = {Model Predictive Control-Guided Reinforcement Learning for Implicit Balancing},
  author = {Seyed Soroush Karimi Madahi and Kenneth Bruninx and Bert Claessens and Chris Develder},
  journal= {arXiv preprint arXiv:2510.04868},
  year   = {2025}
}