面向电网运行的运行时安全护盾层次强化学习
人工智能
2026-04-16 v1 机器学习
摘要
强化学习已显示出在自动化电网运营任务(如拓扑控制和拥塞管理)方面的潜力。然而,其在实际电力系统中部署仍受到严格安全要求、罕见干扰下的脆弱性以及对未见电网拓扑的poor泛化能力的限制。在安全关键基础设施中,灾难性故障不可接受,基于学习的控制器必须在硬物理约束内运行。本文提出一种用于电网运营的安全约束层次控制框架,显式地将长期决策从实时可行性 enforcement 中解耦。高层强化学习策略提出抽象控制动作,而确定性运行时安全护盾通过快速前向仿真过滤不安全的动作。安全性作为运行时不变量强制实施,独立于策略质量或训练分布。该框架在主观条件下、强制线路故障压力测试以及无需重新训练的情况下在ICAPS 2021大型输电网上进行零样本部署进行评估。结果表明,平坦的强化学习策略在压力下脆弱,而仅靠安全的方法则过于保守。相比之下,所提出的层次化和安全感知方法实现了更长的剧集存活时间、较低的峰值线路负载以及对未见电网的稳健零样本泛化。这些结果表明,电网控制中的安全性和泛化性最佳通过架构设计而非日益复杂的奖励工程来实现,为实现可部署的基于学习的控制器在现实能源系统中提供了可行的路径。
引用
@article{arxiv.2604.14032,
title = {Hierarchical Reinforcement Learning with Runtime Safety Shielding for Power Grid Operation},
author = {Gitesh Malik},
journal= {arXiv preprint arXiv:2604.14032},
year = {2026}
}
备注
10 pages, 2 figures