中文

面向电力配电系统恢复的异构多智能体Proximal Policy优化

人工智能 2026-02-03 v5

摘要

恢复大规模停电后的电力配电系统 (PDS) 需要在非线性约束(包括功率平衡、电压限制和热设计限值)下进行有序的开关操作,以重新配置配电器拓扑并协调分布式能源资源 (DER)。这些挑战限制了传统优化和基于价值的强化学习 (RL) 方法的可扩展性。本文应用异构智能体强化学习 (HARL) 框架,通过异构智能体Proximal Policy优化 (HAPPO) 实现跨互联微电网的协调恢复。每个智能体控制一个具有不同负荷、DER 容量和开关数量的微电网。采用集中式 critic 训练分布式 actor,可实现稳定的 on-policy 学习;同时,基于物理的 OpenDSS 环境强制执行电气可行性。在 IEEE 123 节点和 8500 节点配电器测试上,HAPPO 在恢复电力、收敛稳定性和多随机数可重复性方面优于 PPO、QMIX、Mean-Field RL 等基线方法。在 2400 kW 的发电容量限制下,该框架在两个系统上均可实现超过 95% 可用负荷的恢复,执行延迟低,支持实际的实时 PDS 恢复。

关键词

引用

@article{arxiv.2511.14730,
  title  = {Heterogeneous Multi-Agent Proximal Policy Optimization for Power Distribution System Restoration},
  author = {Parya Dolatyabi and Ali Farajzadeh Bavil and Mahdi Khodayar},
  journal= {arXiv preprint arXiv:2511.14730},
  year   = {2026}
}

备注

6 pages, 4 figures