中文

电网中的状态与动作分解

系统与控制 2024-09-10 v1 机器学习 系统与控制

摘要

随着可再生能源发电量增加,目标是实现零排放,控制电网的问题正变得越来越具挑战性。最近一系列名为「Learning To Run a Power Network (L2RPN)」的竞赛鼓励使用强化学习(RL)辅助人类调度员 operating power grids。迄今为止提出的所有解决方案严格限制动作空间,基于单个在整个网格上行动的智能体或多个在配电站水平上独立行动的智能体。在本文中,我们提出了一个基于数据的无域限制算法,用于估计状态和动作组件之间的相关性。将高度相关的状态-动作对组合在一起,以创建更简单、可能独立的子问题,从而导致更少计算和数据需求的不同学习过程。该算法在使用 Grid2Op 模拟器获得的电网基准测试上进行了验证,该基准测试贯穿了上述竞赛,结果表明该算法与域专家分析相符。基于这些结果,我们为使用分布式强化学习以改进现有解决方案奠定了理论基础。

关键词

引用

@article{arxiv.2409.04467,
  title  = {State and Action Factorization in Power Grids},
  author = {Gianvito Losapio and Davide Beretta and Marco Mussi and Alberto Maria Metelli and Marcello Restelli},
  journal= {arXiv preprint arXiv:2409.04467},
  year   = {2024}
}