中文

基于强化学习的端到端网约车微视角订单调度方法

机器学习 2024-08-21 v1 人工智能

摘要

在网约车服务中,基于局部时空上下文将订单分配给司机(微视角订单调度)是一项核心任务,影响着网约车服务体验。现有的工业解决方案主要采用两阶段模式,将启发式或基于学习的方法与朴素的组合方法相结合,以应对双方行为的不确定性,包括出现时间、空间关系和行驶时长等。在本文中,我们提出了一种单阶段端到端强化学习订单调度方法,以序列决策的方式统一解决行为预测与组合优化问题。具体而言,我们采用两层马尔可夫决策过程框架对该问题建模,并提出深度双可扩展网络(D2SN),一种编码器-解码器结构网络,用于直接生成订单-司机分配并停止分配。此外,通过利用上下文动态信息,我们的方法能够适应行为模式以获得更好的性能。在滴滴真实世界基准数据集上的大量实验证明,所提方法在优化匹配效率和用户体验任务方面显著优于竞争性基线。此外,我们评估了部署方案,并从大规模工程实现的角度讨论了部署测试中获得的收益与经验。

关键词

引用

@article{arxiv.2408.10479,
  title  = {An End-to-End Reinforcement Learning Based Approach for Micro-View Order-Dispatching in Ride-Hailing},
  author = {Xinlang Yue and Yiran Liu and Fangzhou Shi and Sihong Luo and Chen Zhong and Min Lu and Zhe Xu},
  journal= {arXiv preprint arXiv:2408.10479},
  year   = {2024}
}

备注

8 pages, 4 figures