降低学习难度:面向基于逆变器的电压-无功控制的一步双评论家深度强化学习
人工智能
2022-07-04 v2
摘要
本文提出一种用于主动配电网中基于逆变器的电压-无功控制(IB-VVC)的一步双评论家深度强化学习(OSTC-DRL)方法。首先,考虑到IB-VVC可表述为单时段优化问题,我们将其建模为一步马尔可夫决策过程而非标准马尔可夫决策过程,从而简化DRL学习任务。随后我们设计了一步 actor-critic DRL 方案,它是近期DRL算法的简化版本,并成功避免了Q值高估问题。此外,考虑到VVC的两个目标:最小化功率损耗与消除电压越限,我们利用两个评论家分别近似两目标的奖励。这简化了个评论家的近似任务,并避免了两目标在评论家学习过程中的交互影响。OSTC-DRL方法集成了一步 actor-critic DRL 方案与双评论家技术。基于OSTC-DRL,我们设计了两种集中式DRL算法。进一步,我们将OSTC-DRL扩展至多智能体OSTC-DRL以用于分散式IB-VVC,并设计了两种多智能体DRL算法。仿真表明,所提OSTC-DRL具有更快收敛速率与更优控制性能,且多智能体OSTC-DRL能良好求解分散式IB-VVC问题。
引用
@article{arxiv.2203.16289,
title = {Reducing Learning Difficulties: One-Step Two-Critic Deep Reinforcement Learning for Inverter-based Volt-Var Control},
author = {Qiong Liu and Ye Guo and Lirong Deng and Haotian Liu and Dongyu Li and Hongbin Sun and Wenqi Huang},
journal= {arXiv preprint arXiv:2203.16289},
year = {2022}
}