通过非对称可微决策树实现可解释的热泵控制强化学习
系统与控制
2025-06-03 v1 机器学习
系统与控制
摘要
近年来,深度强化学习 (DRL) 算法在家庭能源管理系统中获得了广泛关注。然而,由于 DRL 的黑盒性质无法提供透明的决策反馈,能源管理公司对其采用仍然有限。为解决这一问题,可解释强化学习 (XRL) 技术应运而生,旨在使 DRL 决策更加透明。其中,软可微决策树 (DDT) 蒸馏因其基于可高效计算的清晰决策规则,提供了一种有前景的方法。然而,实现高性能往往需要深度且完全丰满的树,这降低了可解释性。为克服这一问题,我们提出了一种新颖的非对称软 DDT 构造方法。与传统软 DDT 不同,我们的方法仅在必要时通过扩展节点来自适应地构造树。这提高了对决策节点的有效利用,而构建完全对称树需要预定深度,从而同时增强了可解释性和性能。我们展示了非对称 DDT 在家庭能源管理系统中提供透明、高效且高性能决策的潜力。
引用
@article{arxiv.2506.01641,
title = {Interpretable reinforcement learning for heat pump control through asymmetric differentiable decision trees},
author = {Toon Van Puyvelde and Mehran Zareh and Chris Develder},
journal= {arXiv preprint arXiv:2506.01641},
year = {2025}
}
备注
7 pages, 3 figures, conference