面向含连续与离散设备的电压/无功控制的两层离策略强化学习
系统与控制
2021-04-14 v1 人工智能
机器学习
系统与控制
摘要
在有源配电网(ADN)的电压/无功控制(VVC)中,涉及慢时间尺度离散设备(STDD)与快时间尺度连续设备(FTCD)。诸如有载分接开关(OLTC)的 STDD 与诸如分布式发电机的 FTCD 应在时间序列上协调。此类 VVC 被建模为两时间尺度优化问题,以联合优化 ADN 中的 FTCD 与 STDD。传统优化方法严重依赖系统的精确模型,但因建模代价过高有时并不实用。本文提出一种新颖的两层离策略强化学习(RL)算法,以无模型方式求解该问题。定义两层马尔可夫决策过程(BMDP)来描述两时间尺度 VVC 问题,并为慢、快时间尺度子问题分别设置智能体。对于快时间尺度子问题,我们采用具有高采样效率的离策略 RL 方法 soft actor-critic。对于慢时间尺度子问题,我们开发了离策略多离散 soft actor-critic(MDSAC)算法,以应对各类 STDD 带来的维数灾难。为缓解两智能体学习过程中存在的非平稳问题,我们采用重要性采样技术提出多时间尺度离策略修正(MTOPC)方法。全面的数值研究不仅表明所提方法可在无任何模型信息下实现 STDD 与 FTCD 的稳定且满意的优化,也证明该方法优于现有两时间尺度 VVC 方法。
引用
@article{arxiv.2104.05902,
title = {Bi-level Off-policy Reinforcement Learning for Volt/VAR Control Involving Continuous and Discrete Devices},
author = {Haotian Liu and Wenchuan Wu},
journal= {arXiv preprint arXiv:2104.05902},
year = {2021}
}
备注
10 pages, 8 figures