利用层次深度强化学习优化电动公交充电调度:面对不确定性
机器学习
2025-05-16 v1
摘要
电动公交 (EB) 的日益普及代表了可持续发展的重要一步。通过利用物联网 (IoT) 系统,充电站可以基于实时数据自动确定充电计划。然而,由于旅行时间、能源消耗和电力价格的不确定性,优化 EB 充电计划仍是关键挑战。此外,为解决现实世界的复杂性,充电策略必须在多个时间尺度上高效决策,并具备应对大型 EB 车队的可扩展性。在本文中,我们提出一种层次深度强化学习 (HDRL) 方法,将原始马尔可夫决策过程 (MDP) 重新表述为两个增强型 MDP。为解决这些 MDP 并实现多时间尺度决策,我们引入一种新型 HDRL 算法,即 Double Actor-Critic Multi-Agent Proximal Policy Optimization Enhancement (DAC-MAPPO-E)。通过在两个决策层面进行增强,解决了 Double Actor-Critic (DAC) 算法在大型 EB 车队中的可扩展性挑战。在高层,我们重新设计了分布式 actor 网络并集成注意力机制,以提取每个 EB 的相关全局状态信息,降低神经网络规模。在低层,集成 Multi-Agent Proximal Policy Optimization (MAPPO) 算法至 DAC 框架中,实现分布式和协调的充电功率决策,减少计算复杂度并提高收敛速度。大量实验使用真实数据表明,DAC-MAPPO-E 在优化 EB 车队充电计划方面性能卓越且具可扩展性。
引用
@article{arxiv.2505.10296,
title = {Optimizing Electric Bus Charging Scheduling with Uncertainties Using Hierarchical Deep Reinforcement Learning},
author = {Jiaju Qi and Lei Lei and Thorsteinn Jonsson and Dusit Niyato},
journal= {arXiv preprint arXiv:2505.10296},
year = {2025}
}