中文

需求响应中用于学习并选择用户的可靠性感知多臂_bandit方法

系统与控制 2020-03-24 v1 系统与控制

摘要

社会系统优化与控制中的一个挑战是处理未知且不确定的用户行为。本文关注居民需求响应(DR),并提出一种闭环学习方案来解决这些问题。具体而言,我们考虑聚合商召集居民用户改变其需求以使总负荷调整接近目标值的DR程序。为了学习并选择正确的用户,我们将DR问题表述为具有可靠性目标的组合多臂_bandit(CMAB)问题。我们提出一种学习算法:CUCB-Avg(组合上置信界-平均),它利用上置信界和样本平均来平衡探索(学习)与利用(选择)之间的权衡。我们考虑固定时不变目标和时变目标,并证明CUCB-Avg分别达到O(logT)O(\log T)O(Tlog(T))O(\sqrt{T \log(T)})的悔值(regret)。最后,我们使用合成和真实数据对我们的算法进行数值测试,并证明我们的CUCB-Avg显著优于经典CUCB,也优于Thompson采样。

关键词

引用

@article{arxiv.2003.09505,
  title  = {A Reliability-aware Multi-armed Bandit Approach to Learn and Select Users in Demand Response},
  author = {Yingying Li and Qinran Hu and Na Li},
  journal= {arXiv preprint arXiv:2003.09505},
  year   = {2020}
}