基于强化学习的车联网充电方法:考虑异构智能体与长期奖励
机器学习
2025-02-27 v1 人工智能
摘要
将电动汽车电池战略性地聚合作为能源储备可以优化电网需求,为智能和互连的社区,尤其是提供工作场所充电的大型办公楼带来便利。这涉及优化充电和放电以减少峰值能源成本和净峰值需求,监控周期为数月甚至更长时间(例如一个月),这涉及在不确定性下进行顺序决策、延迟和稀疏奖励,以及连续动作空间,以及确保跨多样化条件的泛化。现有的算法方法,如基于启发式的方法,难以应对动态条件下的实时决策,传统强化学习(RL)模型在处理大规模状态-动作空间、多智能体设置以及长期奖励优化方面也面临挑战。为此,我们引入了一种新型RL框架,将深度确定性策略梯度方法(DDPG)与动作掩码和高效的线性可规划(MILP)驱动的政策指导相结合。我们的做法在满足用户充电需求的同时,平衡了连续动作空间的探索。我们使用来自大型电动汽车制造商的真实数据,展示了我们的方法在多个基准和多个可扩展启发式方法上综合性能显著优于现有方法,实现了显著的成本节省,同时满足所有充电要求。我们的结果表明,本方法是解决车联网能源管理挑战的第一个可扩展且通用的方法。
引用
@article{arxiv.2502.18526,
title = {Reinforcement Learning-based Approach for Vehicle-to-Building Charging with Heterogeneous Agents and Long Term Rewards},
author = {Fangqi Liu and Rishav Sen and Jose Paolo Talusan and Ava Pettet and Aaron Kandel and Yoshinori Suzue and Ayan Mukhopadhyay and Abhishek Dubey},
journal= {arXiv preprint arXiv:2502.18526},
year = {2025}
}