SED2AM: 利用深度强化学习求解多行程时间依赖车辆路径问题
人工智能
2025-03-07 v1 机器学习
摘要
以 Transformer 风格策略网络为特征的深度强化学习(DRL)框架已在各种车辆路径问题(VRP)变体中展示了其有效性。然而,将这些方法应用于具有最大工作时长约束的多行程时间依赖车辆路径问题(MTTDVRP)——城市物流的核心要素——仍 largely 未被探索。本论文提出了一种名为同时编码器与双解码器注意力模型(SED2AM)的 DRL 方法,专为具有最大工作时长约束的 MTTDVRP 而设计。所提方法在策略网络的编码模块中引入了时间局部性归纳偏置,使其能够有效考虑行程距离或时间中的时间依赖性。SED2AM 的解码模块包含一个车辆选择解码器,用于从车队中选择车辆,有效地将行程与车辆关联以实现功能性的多行程路由。此外,该解码模块配备了一个行程构建解码器,用于为车辆构建行程。该策略模型配备了两类状态表示——车队状态与路由状态——提供了在最大工作时长约束下进行有效路径构建所需的信息。利用两个加拿大主要城市的真实数据集进行的实验结果不仅表明 SED2AM 超越了当前最先进的 DRL 基线与元启发式基线,还展示了其求解更大规模问题的泛化能力。
引用
@article{arxiv.2503.04085,
title = {SED2AM: Solving Multi-Trip Time-Dependent Vehicle Routing Problem using Deep Reinforcement Learning},
author = {Arash Mozhdehi and Yunli Wang and Sun Sun and Xin Wang},
journal= {arXiv preprint arXiv:2503.04085},
year = {2025}
}
备注
Accepted by ACM TKDD: https://dl.acm.org/doi/10.1145/3721983