面向众包城市配送的深度强化学习:系统状态刻画、启发式引导动作选择与规则嵌入集成
人工智能
2020-12-01 v1 机器学习
摘要
本文研究了众包城市配送背景下将配送请求分配给临时快递员的问题。配送请求在空间上分散,每个请求具有从最早取件时间到最晚送达时间之间的有限时间窗。被称为众包承运人的临时快递员同样具有有限的时间可用性与运载能力。我们提出了一种基于深度强化学习(DRL)的新方法来解决该分配问题。训练了一个深度 Q 网络(DQN)算法,其包含经验回放与目标网络两个显著特征,可提升 DRL 训练的效率和收敛性与稳定性。更重要的是,本文做出了三点方法学贡献:1)对众包配送系统状态进行了全面而新颖的刻画,涵盖众包承运人与请求的空间—时间以及容量信息;2)嵌入启发式规则,利用状态表示提供的信息并基于直观推理来引导采取特定动作,以保持可处理性并提升训练效率;3)集成规则嵌入以防止在路径改进过程中重复访问相同路线与节点序列,从而通过加速学习进一步提升训练效率。所提方法的有效性通过大量数值分析得到验证。结果表明,启发式引导动作选择与规则嵌入为 DRL 训练带来了益处,且所提方法在解质量、时间与可扩展性上均优于现有启发式方法。除有望提升众包配送运营规划效率外,所提方法也为车辆路径背景下其他问题提供了新途径与通用框架。
引用
@article{arxiv.2011.14430,
title = {Deep Reinforcement Learning for Crowdsourced Urban Delivery: System States Characterization, Heuristics-guided Action Choice, and Rule-Interposing Integration},
author = {Tanvir Ahamed and Bo Zou and Nahid Parvez Farazi and Theja Tulabandhula},
journal= {arXiv preprint arXiv:2011.14430},
year = {2020}
}
备注
50 pages, 17 figures