中文

基于 Gibbs 先验的物理信息强化学习用于电网拓扑控制

机器学习 2026-04-03 v1 系统与控制 系统与控制

摘要

电网拓扑控制是因电网规模增大导致动作空间呈组合式增长,且通过仿真评估动作计算成本高昂的顺序决策问题。我们提出一种物理信息强化学习框架,将半马尔可夫控制与 Gibbs 先验相结合,该先验编码了系统的物理特性,覆盖整个动作空间。在网格进入危险状态时才做出决策,而图神经网络代理模型预测可行拓扑动作执行后的超载风险。这些预测用于构建物理信息 Gibbs 先验,既筛选出小型状态依赖的候选集,又在动作选择前对策略 logits 进行重新加权。如此一来,我们的方法在保持学习策略灵活性的同时,显著降低了探索难度和在线仿真成本。我们在三个现实基准环境中进行评估,其中难度递增。总体而言,所提方法在控制质量与计算效率之间取得优异平衡:在第一个基准中,性能接近 oracle 级别,快约 6 倍;在第二个基准中,以约 200 倍的决策时间实现 94.6% 的 oracle 奖励;在最具挑战性的基准中,相较于 PPO 基线,在奖励上提升最高可达 255%,在存活步数上提升最高可达 284%,同时仅快约 2.5 倍。这些结果表明,所提方法为电网拓扑控制提供了有效机制。

关键词

引用

@article{arxiv.2604.01830,
  title  = {Physics Informed Reinforcement Learning with Gibbs Priors for Topology Control in Power Grids},
  author = {Pantelis Dogoulis and Maxime Cordy},
  journal= {arXiv preprint arXiv:2604.01830},
  year   = {2026}
}