中文

Counter-Dyna:基于反事实建筑模型的数据高效强化学习 HVAC 控制

机器学习 2026-05-07 v1 系统与控制 系统与控制

摘要

基于模型的强化学习(MBRL)为建筑中数据高效的能源管理提供了一种有前景的方法,它结合了预测建模和强化学习的优势。虽然先前应用于 HVAC 控制的 MBRL 方法减少了训练数据需求,但它们仍需要与建筑进行数月的交互才能学习到令人满意的控制策略。一个关键原因是,现有的代理模型试图预测整个状态空间,包括不受控制动作影响的天气和电价,或者完全忽略这些变量。针对这些问题,我们提出了 Counter-Dyna,一种增强 MBRL 方法 Dyna 数据效率的方法。我们通过利用状态空间中的不变性创建了数据高效的反事实代理模型(CSM)。与之前的结果相比,在 Dyna 中使用 CSM 加快了以环境交互数据衡量的 RL 训练速度。与使用 6-12 个月环境交互的先前 SOTA 相比,我们的方法仅需 5 周。我们在一项大规模仿真研究中评估了我们的方法,使用了文献标准的 BOPTEST 框架和近端策略优化算法(PPO)作为 RL 算法。我们的结果显示,在假设的部署场景中具有 5.3% 至 17.0% 的节能潜力。我们的工作向使 RL 算法在 HVAC 控制中的实际部署切实可行迈出了重要一步。

关键词

引用

@article{arxiv.2605.04555,
  title  = {Counter-Dyna: Data-Efficient RL-Based HVAC Control using Counterfactual Building Models},
  author = {Jan Marco Ruiz de Vargas and Fabian Raisch and Zoltan Nagy and Pierre Pinson and Christoph Goebel},
  journal= {arXiv preprint arXiv:2605.04555},
  year   = {2026}
}