中文

基于深度强化学习的餐饮配送平台实时综合调度与闲置车队引导

系统与控制 2025-01-14 v1 人工智能 系统与控制

摘要

为实现高服务质量和盈利性,像 Uber Eats 和 Grubhub 这样的餐饮配送平台必须战略性地运营其车队,以确保当前订单及时送达,同时缓解次优决策导致的未来 courier 缺乏问题。本研究旨在解决餐饮配送平台的实时订单调度和闲置 courier 引导问题,通过提出一种基于强化学习(RL)的战略双控制框架。为解决这些问题的内在序列性质,我们将订单调度和 courier 引导建模为马尔可夫决策过程(MDP)。通过深度强化学习(DRL)框架进行训练,我们利用显式预测需求作为输入,获取战略策略。在我们的双控制框架中,调度和引导策略以迭代方式进行集成训练。这些前瞻性策略可在实时内执行,并在考虑局部和网络层次影响的情况下提供决策。为增强调度公平性,我们提出卷积深度 Q 网络以构建公平的 courier 嵌入。为同时在服务网络内重新平衡供需,我们提出利用均值场近似的供需知识在局部层次重新分配闲置 courier。利用 RL 基于的战略双控制框架生成的策略,我们发现配送效率和工作负荷在 courier 之间分配的公平性得到改善,服务网络内的欠供情况得到缓解。本研究为设计一种使餐饮配送平台及其他按需服务实现前瞻实时运营的 RL 框架提供了启发。

关键词

引用

@article{arxiv.2501.05808,
  title  = {Real-Time Integrated Dispatching and Idle Fleet Steering with Deep Reinforcement Learning for A Meal Delivery Platform},
  author = {Jingyi Cheng and Shadi Sharif Azadeh},
  journal= {arXiv preprint arXiv:2501.05808},
  year   = {2025}
}