时段车辆路径优化:基于深度强化学习与 NSGA-II 的混合方法
人工智能
2024-07-19 v1
摘要
本文提出一种重量感知深度强化学习(WADRL)方法,旨在解决带时段的多目标车辆路径问题(MOVRPTW),目标是使用单一深度强化学习(DRL)模型解决整个多目标优化问题。随后采用非支配排序遗传算法-II(NSGA-II)方法优化由 WADRL 产生的结果,以缓解两种方法的局限性。首先,我们设计了 MOVRPTW 模型,以平衡旅行成本最小化与客户满意度最大化。随后,我们提出一种新型 DRL 框架,包含基于 Transformer 的策略网络,该网络由编码器模块、权重嵌入模块(其中包含目标函数权重)以及解码器模块组成。然后,利用 NSGA-II 优化由 WADRL 生成的解。最终,大量实验结果表明,我们的方法优于现有和传统方法。由于 VRPTW 的约束条件众多,生成 NSGA-II 算法的初始解可能耗时较长。然而,使用由 WADRL 生成的解作为 NSGA-II 的初始解,可显著缩短生成初始解所需时间。同时,NSGA-II 可提高由 WADRL 生成解的质量, resulting in better scalability 的解。值得注意的是,重量感知策略显著减少了 DRL 的训练时间,同时取得更好结果,使单一 DRL 模型能够解决整个多目标优化问题。
引用
@article{arxiv.2407.13113,
title = {Multiobjective Vehicle Routing Optimization with Time Windows: A Hybrid Approach Using Deep Reinforcement Learning and NSGA-II},
author = {Rixin Wu and Ran Wang and Jie Hao and Qiang Wu and Ping Wang and Dusit Niyato},
journal= {arXiv preprint arXiv:2407.13113},
year = {2024}
}
备注
13 pages; Under Review; Submitted to IEEE Transactions on Intelligent Transportation Systems