基于大语言模型引导的安全强化学习能源系统拓扑重配置
系统与控制
2026-03-17 v1 系统与控制
摘要
可再生发电渗透率的增加以及电气化需求的日益波动,给现代电力系统带来了巨大的运行不确定性。拓扑重配置被广泛认为是提高电网韧性的有效且经济的方式。由于交叉交流潮流约束与离散开关决策的共存,大规模系统中的拓扑重配置导致高度非线性和非凸的优化问题,使传统方法在计算上不可行。因此, several 研究探索了基于强化学习的方法来提高可扩展性和操作效率。然而,其实际实施面临高维组合动作空间和确保学习过程中安全决策的挑战。为了解决这些挑战,本文提出了一种安全且智能的拓扑控制框架,将大语言模型(LLM)与安全软演员-评论家(Safety-SAC)架构集成。将运行电压和热限制重新表述为平滑的安全成本信号,在受限马尔可夫决策过程中实现风险感知的策略优化。进一步引入基于知识的Safety-LLM模块,通过领域知识和状态感知推理来细化不安全或次优的转换,从而引导学习智能体采取更安全、更有效的开关动作。在IEEE 36-bus和118-bus Grid2Op基准测试中实验表明,所提出的方法在奖励、生存时间和安全指标上 consistently 获得改进,实现更高的奖励、更长的生存时间和更低的安全成本,优于SAC、ACE及其安全增强变体。这些结果表明了将LLM基于推理与安全强化学习相结合以实现可扩展且可靠电网拓扑控制的潜力。
引用
@article{arxiv.2603.14018,
title = {LLM-Guided Safe Reinforcement Learning for Energy System Topology Reconfiguration},
author = {Zongyan Zhang and Chao Shen and Xu Wan and Jie Song and Mingyang Sun},
journal= {arXiv preprint arXiv:2603.14018},
year = {2026}
}