强化学习能否习得精细调度策略?——以动态快递员调度系统为例
人工智能
2019-03-08 v1
摘要
本文研究由阿里巴巴在线取件服务平台提出的快递员调度问题(CDP)。CDP旨在分配一组快递员,以服务于城市区域间具有随机时空到达率的取件请求。目标是在有限数量的快递员和一段时间内最大化已服务请求的收入。现有文献中的许多在线算法,如动态匹配和车辆路径策略,可用于解决此问题。然而,这些方法依赖于在每个决策点适当预定义的优化目标,这在动态情况下是困难的。本文将CDP建模为马尔可夫决策过程(MDP),并提出一种数据驱动方法以推导不同场景下的最优调度规则集。我们的方法堆叠时空图的多层图像,并应用多智能体强化学习(MARL)技术来演化调度模型。该方法解决了传统集中式MDP建模导致的学习效率低下问题。通过在人工数据集和真实世界数据集上的综合实验,我们表明:1)通过利用历史数据并考虑长期收益,MARL比短视在线算法取得更好性能;2)MARL能够构建复杂场景到精细决策(如调度规则)的映射;3)MARL具有在大规模真实场景中使用可扩展性。
引用
@article{arxiv.1903.02716,
title = {Can Sophisticated Dispatching Strategy Acquired by Reinforcement Learning? - A Case Study in Dynamic Courier Dispatching System},
author = {Yujie Chen and Yu Qian and Yichen Yao and Zili Wu and Rongqi Li and Yinzhi Zhou and Haoyuan Hu and Yinghui Xu},
journal= {arXiv preprint arXiv:1903.02716},
year = {2019}
}