中文

基于分层深度强化学习的数据驱动目标的电动公交充电时刻表

机器学习 2025-05-16 v1

摘要

本文基于深度强化学习(DRL)研究电动公交(EB)的充电调度问题。构构了一个马尔可夫决策过程(MDP),其时间范围包括一天中的多个充电和运行时段,而每个时段进一步划分为多个时间步。为解决长程多阶段规划稀疏奖励的挑战,本文构思了分层深度强化学习(HDRL),将原始MDP解耦为高层半马尔可夫决策过程(SMDP)和多个低层MDP。提出了层次双深Q网络(HDDQN)与远见经验回放(HER)算法,用于同时解决不同时间分辨率下的决策问题。结果表明,高层智能体学习到的针对每个充电时段的充电目标策略,以及低层智能体学习到的针对单个充电时段中每个时间步的充电功率策略,均能在满足充电目标的前提下最小化充电成本。证明了由叠加最优高层策略和最优低层策略构建的平坦策略性能与原始MDP的最优策略相当。由于高层智能体的非平稳性和低层智能体的采样效率低下,联合学习两层策略具有挑战性。因此,将联合学习过程分为两个阶段,并利用新的HER算法操作两个智能体的经验回放缓冲区。本文采用真实世界数据进行数值实验,以评估所提出算法的性能。

关键词

引用

@article{arxiv.2505.10262,
  title  = {Electric Bus Charging Schedules Relying on Real Data-Driven Targets Based on Hierarchical Deep Reinforcement Learning},
  author = {Jiaju Qi and Lei Lei and Thorsteinn Jonsson and Lajos Hanzo},
  journal= {arXiv preprint arXiv:2505.10262},
  year   = {2025}
}