中文

基于行为克隆的通用强化学习建筑控制

系统与控制 2021-04-02 v1 系统与控制

摘要

模型预测控制(MPC)等先进建筑控制方法对消费者与电网运营商均具有显著潜在效益,但高昂的计算需求阻碍了更广泛的应用。本地控制计算需安装昂贵的计算硬件,而云计算则带来数据安全与隐私问题。本文通过一种称为行为克隆(Behavioral Cloning)的基于强化学习(RL)的方法大幅降低先进建筑控制的本地计算需求,该方法将 MPC 策略表示为可本地实现并在低成本可编程逻辑控制器上快速计算的神经网络。先前 RL 与近似 MPC 方法须针对每栋建筑专门训练,我们的关键改进在于控制器可泛化至许多建筑、电价与恒温器设定 schedule 而无需额外费力的重新训练。为提供此种通用性,我们通过以下方式改进传统行为克隆方法:(1)约束知情参数分组(CIPG)方法,提供更高效的训练数据表示;(2)使用 DAgger 算法的 MPC 引导训练数据生成方法,改善稳定性与约束满足;(3)一种称为逆时循环神经网络(RT-RNN)的新深度学习模型结构,允许未来信息反向流动以更有效解读扰动预测中的时序信息。结果是一个易于部署、通用的 MPC 行为克隆体,可在可编程逻辑控制器上实现,且几乎不需要建筑专用的控制器调参,降低了实施智能住宅热泵控制的精力与成本。

关键词

引用

@article{arxiv.2104.00123,
  title  = {Generalized Reinforcement Learning for Building Control using Behavioral Cloning},
  author = {Zachary E. Lee and K. Max Zhang},
  journal= {arXiv preprint arXiv:2104.00123},
  year   = {2021}
}

备注

submitted to Applied Energy 2021