面向电动汽车路径规划问题的基于课程的深度强化学习框架
机器学习
2026-01-22 v1 人工智能
摘要
带时间窗的电动汽车路径规划问题(EVRPTW)是可持续物流中一个复杂的优化问题,其中路径规划决策必须在满足严格客户时间约束的同时,最小化总行驶距离、车队规模和电池消耗。尽管深度强化学习(DRL)已展现出作为经典启发式和精确求解器替代方案的巨大潜力,但现有的 DRL 模型往往难以保持训练稳定性——在约束密集时无法收敛或泛化。在本研究中,我们提出了一种基于课程的深度强化学习(CB-DRL)框架,旨在解决这种不稳定性。该框架采用结构化的三阶段课程,逐步增加问题复杂度:智能体首先学习距离和车队优化(阶段 A),然后学习电池管理(阶段 B),最后学习完整的 EVRPTW(阶段 C)。为确保跨阶段的学习稳定性,该框架采用了一种改进的近端策略优化算法,配备了阶段特定的超参数、价值和优势裁剪以及自适应学习率调度。策略网络构建于异构图注意力编码器之上,并通过全局-局部注意力和特征级线性调制进行增强。这种专门的架构显式地捕捉了车场、客户和充电站的独特属性。该模型仅在 N=10 个客户的小规模实例上进行训练,即对 N=5 到 N=100 的未见实例展现出稳健的泛化能力,在中等规模问题上显著优于标准基线。实验结果证实,这种课程引导的方法在标准 DRL 基线失效的分布外实例上实现了高可行率和具竞争力的求解质量,有效弥合了神经计算速度与运行可靠性之间的差距。
关键词
引用
@article{arxiv.2601.15038,
title = {A Curriculum-Based Deep Reinforcement Learning Framework for the Electric Vehicle Routing Problem},
author = {Mertcan Daysalilar and Fuat Uyguroglu and Gabriel Nicolosi and Adam Meyers},
journal= {arXiv preprint arXiv:2601.15038},
year = {2026}
}