中文

一步即足:基于单步策略优化的多智能体强化学习在出租车调度平台的应用

人工智能 2026-04-17 v3 新兴技术 多智能体系统

摘要

订单调度是自动驾驶出租车系统中的关键任务,直接影响效率和利润。最近的多智能体强化学习(MARL)因在单个智能体之间分解大规模状态和动作空间而成为解决该问题的有前景的方案,有效地解决了由大量车辆、乘客和订单数量所导致的 transportation market 的维度灾难(Curse of Dimensionality, CoD)。然而,传统的基于MARL的方法高度依赖于准确的价值函数估计,在大规模、高度不确定的环境中变得棘手。为此,我们提出了两种新方法,绕过价值函数估计,利用AV车队的均匀性。首先,我们类比AV车队与群体相对策略优化(Group Relative Policy Optimization, GRPO)中的群体,将其应用于订单调度任务。通过用群体平均奖励-到-终点(group average reward-to-go)取代PPO基线,GRPO消除了批评估计误差,减少了训练偏差。灵感来源于这种基线替换,我们进一步提出了单步策略优化(One-Step Policy Optimization, OSPO),证明在均匀车队下,仅使用单步群体奖励即可训练最优策略。在真实世界的出租车叫车数据集上的实验表明,GRPO和OSP两种方法在所有场景中都取得了令人满意的性能,使用简单的多层感知器(MLP)网络高效地优化了 pickup 时间和服务订单数。此外,OSP在所有场景中都优于GRPO,这归因于其消除了GRPO受限时间范围导致的偏差。我们的代码、训练好的模型和处理后的数据已提供于 https://github.com/RS2002/OSPO。

关键词

引用

@article{arxiv.2507.15351,
  title  = {One Step is Enough: Multi-Agent Reinforcement Learning based on One-Step Policy Optimization for Order Dispatch on Ride-Sharing Platforms},
  author = {Zijian Zhao and Sen Li},
  journal= {arXiv preprint arXiv:2507.15351},
  year   = {2026}
}