PIRS:基于软演员-专家(SAC)的建筑能源管理中的物理信息奖励塑形
摘要
居民舒适度与网格感知能源效率是两大矛盾目标,其联合优化取决于深度强化学习(DRL)控制器中奖励函数的设计方式。然而,奖励设计仍 largely ad hoc:舒适度项要么是经验调参的 heuristic,要么是未明确关联热舒适物理的简单温度偏差代理。我们提出了 PIRS(Physics-Informed Reward Shaping),将其替换为软演员-专家(SAC)加权多目标奖励中的 ISO 7730 预测平均投票(PMV)公式。通过将舒适信号锚定于 ISO 7730 PMV 公式,PIRS 提升了奖励的可解释性,提供一个以标准为依据的舒适代理,而无需改变学习管道的其他任何组件。我们在 CityLearn v2.1.2(2022 年挑战赛阶段 1)中评估了 PIRS,使用中心 SAC 代理训练 5 万步,跨五个随机种子,并与基于规则的控制器(RBC)、手动工程奖励(E2)、仅能源奖励(E3)以及粗糙温度偏差舒适奖励(E4)进行比较。 District 级别的关键绩效指标(KPIs),以 RBC 为基准的比值显示,PIRS 在成本、碳排放和电力指标上与手动基线持平,显著优于非物理依据的设计——尤其在负荷斜率(1.78 倍 vs. ~2.4 倍 RBC)和日峰值需求方面。所有 DRL 策略在该训练预算下均保持在 RBC 之上;我们诚实地解释这一差距,并将 PIRS 定位为一个可解释且符合标准的奖励设计基础,而非声称在有限计算资源下超越经典控制。
引用
@article{arxiv.2605.28232,
title = {PIRS: Physics-Informed Reward Shaping for SAC-Based Building Energy Management},
author = {Shadmehr Zaregarizi and Khashayar Yavari},
journal= {arXiv preprint arXiv:2605.28232},
year = {2026}
}
备注
N pages, 4 figures, 3 tables. Accepted at the 2nd Workshop on AI-Driven Energy Efficiency in Dynamic Systems (AI-DEEDS '26), co-located with ACM e-Energy / ACM Sustainability Week, Banff, AB, Canada, June 22-25, 2026