面向随机多目标 C-VRPTW 的端到端深度强化学习
机器学习
2025-12-02 v1
摘要
本文关注于学习方法在路由问题中的应用,以求解具有随机性和多目标特征的车辆路径问题变体。此类问题体现了实际场景:决策者需在操作环境不确定性以及由不同利益相关者导致的多目标冲突之间进行平衡。我们特别关注旅行时间的不确定性。同时考虑总旅行时间和路径制盹时间两个目标,旨同时满足运营效率和劳动法规对班次时长的要求,尽管也可纳入其他目标。学习方法在解决此类问题时具有显著的计算优势:它们可在有限的干扰下重复求解问题。我们特别关注能够利用注意力机制和多个解答轨迹的端到端深度学习模型,这些模型在路由问题中已取得多项成功应用。然而,由于旅行时间矩阵维度大,旅行时间并非直接输入模型,使得在多目标情境下考虑不确定性具有挑战性。为此,我们提出一种同时处理随机性和多目标性的模型,并通过场景聚类来减少训练时间,提供该模型的优化训练机制。我们的结果表明,该模型能够在可接受的运行时间内构建出质量较好的帕累托前沿,与三个基线方法相比表现更优。
引用
@article{arxiv.2512.01518,
title = {End-to-end Deep Reinforcement Learning for Stochastic Multi-objective Optimization in C-VRPTW},
author = {Abdo Abouelrous and Laurens Bliek and Yaoxin Wu and Yingqian Zhang},
journal= {arXiv preprint arXiv:2512.01518},
year = {2025}
}
备注
25 pages, 5 figures