基于上下文多臂_bandit的在线居民需求响应
系统与控制
2020-05-19 v2 机器学习
系统与控制
摘要
居民负荷通过需求响应(DR)项目在提升电力系统效率与可靠性方面具有巨大潜力。居民DR的一大挑战在于处理未知且不确定的用户行为。已有工作利用学习技术预测用户DR行为,但普遍忽视了时变环境因素的影响,这可能导致预测不准确及负荷调节效率低下。本文研究居民DR问题,其中负荷服务实体(LSE)旨在给定财务预算下选择最优用户子集以最大化期望负荷削减量。为在环境影响下学习不确定的用户行为,我们将居民DR建模为上下文多臂_bandit(MAB)问题,并提出基于Thompson采样的在线学习与选择(OLS)算法予以求解。该算法考虑了上下文信息,适用于复杂的DR场景。数值仿真验证了所提算法的学习有效性。
引用
@article{arxiv.2003.03627,
title = {Online Residential Demand Response via Contextual Multi-Armed Bandits},
author = {Xin Chen and Yutong Nie and Na Li},
journal= {arXiv preprint arXiv:2003.03627},
year = {2020}
}