基于课程学习的电网拓扑控制器强化学习以防止热级联
系统与控制
2021-12-21 v1 人工智能
系统与控制
摘要
本文描述了如何将电力系统运营商的领域知识整合进强化学习(RL)框架,以有效学习控制电网拓扑以防止热级联的智能体。典型的基于RL的拓扑控制器由于庞大的搜索/优化空间而表现不佳。在此,我们提出一种基于actor-critic的智能体以应对该问题的组合性质,并使用法国输电系统运营商RTE开发的RL环境训练该智能体。为应对庞大优化空间的挑战,通过在环境中利用网络物理修改以增强智能体学习,将带奖励调优的基于课程的方法纳入训练过程。此外,采用多场景并行训练方法以避免智能体偏倚于少数场景,并使其对电网运行中的自然变化具有鲁棒性。若不对训练过程作这些修改,RL智能体在多数测试场景中失败,说明了为真实世界RL学习恰当整合物理系统领域知识的重要性。该智能体由RTE在2019年“学习运行电网”挑战赛中测试,获精度第二名与速度第一名。所开发代码已开源供公众使用。
引用
@article{arxiv.2112.09996,
title = {Curriculum Based Reinforcement Learning of Grid Topology Controllers to Prevent Thermal Cascading},
author = {Amarsagar Reddy Ramapuram Matavalam and Kishan Prudhvi Guddanti and Yang Weng and Venkataramana Ajjarapu},
journal= {arXiv preprint arXiv:2112.09996},
year = {2021}
}