中文

基于上下文元图强化学习的高泛化与小样本自适应随机动态电力调度

机器学习 2024-01-24 v1 系统与控制 系统与控制

摘要

强化学习是促进多阶段序贯决策问题的一种新兴方法。本文研究了考虑多元不确定性的实时多阶段随机电力调度。当前研究存在泛化能力低和实用性差的问题,即学习到的调度策略只能处理特定的调度场景,当实际样本与训练样本不一致时,其性能会显著下降。为填补这些空白,本文提出了一种新颖的上下文元图强化学习(Meta-GRL)方法,用于实现高度泛化的多阶段最优调度策略。具体而言,我们引入了一个更通用的上下文马尔可夫决策过程(MDP)和可扩展的图表示,以实现更具泛化性的多阶段随机电力调度建模。我们提出了一个上层元学习器,用于编码不同调度场景的上下文并学习如何实现调度任务识别,而下层策略学习器则学习上下文特定的调度策略。经过充分的离线学习后,该方法只需对元学习器生成的假设判断进行少量更新,即可快速适应未见过的、未定义的场景。与最先进的策略和传统强化学习的数值比较验证了所提出的Meta-GRL的最优性、高效性、适应性和可扩展性。

关键词

引用

@article{arxiv.2401.12235,
  title  = {Stochastic Dynamic Power Dispatch with High Generalization and Few-Shot Adaption via Contextual Meta Graph Reinforcement Learning},
  author = {Bairong Deng and Tao Yu and Zhenning Pan and Xuehan Zhang and Yufeng Wu and Qiaoyi Ding},
  journal= {arXiv preprint arXiv:2401.12235},
  year   = {2024}
}