基于强化学习能源套利策略的控制政策修正框架
系统与控制
2024-05-01 v2 人工智能
机器学习
系统与控制
摘要
可再生能源渗透率的持续上升,以及单一不平衡定价的使用,为平衡负责方通过能源套利机构降低成本提供了新的机会。由于其在解决复杂随机序列问题方面的卓越性能,基于模型无关的强化学习(RL)方法是解决能源套利问题的合适选择。然而,由于所学策略在执行阶段不一定保证安全,RL 很少部署于实际应用中。本文提出一种新的 RL 基于能源套利的控制框架,用于电池以获取不平衡定价机制下的安全能源套利策略。在我们提出的控制框架中,智能体最初旨在优化套利收益。随后,在后处理步骤中,我们基于遵循人类直觉的属性进行知识蒸馏过程,对所学策略进行纠正(约束)。我们的后处理步骤是一种通用方法,仅限于能源套利领域。我们使用比利时不平衡价格的 2023 年数据评估我们提出框架的性能。此外,我们在实际电池上部署我们提出的控制框架,以展示其在实际中的能力。
引用
@article{arxiv.2404.18821,
title = {Control Policy Correction Framework for Reinforcement Learning-based Energy Arbitrage Strategies},
author = {Seyed Soroush Karimi Madahi and Gargya Gokhale and Marie-Sophie Verwee and Bert Claessens and Chris Develder},
journal= {arXiv preprint arXiv:2404.18821},
year = {2024}
}
备注
ACM e-Energy 2024