基于马尔可夫决策过程与模仿学习的网约车平台最优寻客策略
机器学习
2020-02-04 v3 机器学习
摘要
道路网中空驶出租车司机的寻客过程会产生额外的车辆行驶里程,给道路网与环境增加拥堵和污染。本文旨在采用马尔可夫决策过程(Markov Decision Process, MDP)对闲置网约车司机的寻客最优序贯决策进行建模。交通网络公司(Transportation Network Companies, TNC)或网约车(如滴滴、Uber)司机表现出不同于传统出租车司机的行为,因为网约车司机无需实际搜寻乘客。相反,他们对自己进行重新定位,以便匹配平台能够为其匹配乘客。相应地,我们将网约车司机的新特征纳入我们的 MDP 模型。MDP 模型中使用的奖励函数通过利用逆强化学习技术得以揭示。随后,我们使用 44,160 名滴滴司机的 3 天轨迹来训练该模型。为验证模型有效性,进行了蒙特卡洛模拟以模拟司机在最优策略指导下的表现,并与遵循一种基线启发式策略(即局部热点策略)的司机表现进行比较。结果显示,我们的模型在回报率方面比局部热点策略实现了 17.5% 的提升。所提出的 MDP 模型考虑了供需比,鉴于本研究中的司机数量足够大,从而假设未匹配订单数可忽略不计。为了更好地将多名司机间的竞争纳入模型,我们还设计并校准了一种订单匹配概率的动态调整策略。
引用
@article{arxiv.1905.09906,
title = {Optimal Passenger-Seeking Policies on E-hailing Platforms Using Markov Decision Process and Imitation Learning},
author = {Zhenyu Shou and Xuan Di and Jieping Ye and Hongtu Zhu and Hua Zhang and Robert Hampshire},
journal= {arXiv preprint arXiv:1905.09906},
year = {2020}
}
备注
23 pages, 16 figures, published in Transportation Research Part C 111 (2020) 91-113