基于深度值网络的多司机订单派单方法
机器学习
2021-06-09 v1 人工智能
摘要
近期关于网约车订单派单的研究强调了在派单过程中考虑时空动态以提升交通系统效率的重要性。与此同时,深度强化学习已发展到在多个领域取得超越人类表现的程度。在本文中,我们提出了一种基于深度强化学习的订单派单解决方案,并在滴滴的订单派单平台上进行了大规模在线 A/B 测试,表明所提方法在司机总收入和与用户体验相关的指标上均取得显著提升。具体而言,我们将订单派单问题建模为半马尔可夫决策过程以考虑派单动作的时间特性。为提升使用神经网络等非线性函数逼近器时值迭代的稳定性,我们提出了具有新颖分布式状态表示层的 Cerebellar Value Networks (CVNet)。我们进一步推导了 CVNet 的正则化策略评估方案,该方案通过对值网络的大 Lipschitz 常数进行惩罚,以增强对对抗扰动和噪声的鲁棒性。最后,我们适配多种迁移学习方法至 CVNet,以提升跨城市的学习适应性与效率。我们基于真实派单数据进行了大量离线仿真,并通过滴滴平台进行了在线 A/B 测试。结果表明 CVNet 持续优于其他近期提出的派单方法。我们最后展示了通过高效使用迁移学习可进一步提升性能。
引用
@article{arxiv.2106.04493,
title = {A Deep Value-network Based Approach for Multi-Driver Order Dispatching},
author = {Xiaocheng Tang and Zhiwei Qin and Fan Zhang and Zhaodong Wang and Zhe Xu and Yintai Ma and Hongtu Zhu and Jieping Ye},
journal= {arXiv preprint arXiv:2106.04493},
year = {2021}
}
备注
KDD 2019 Oral