Triple-BERT:我们真的需要为叫车平台的订单分配使用MARL吗?
机器学习
2026-01-01 v2 人工智能
多智能体系统
摘要
按需叫车平台(如Uber和Lyft)面临的挑战是将具有不同起点和终点的乘客——每个都有其独特需求——与可用车辆进行精准的捆绑和匹配,同时要应对显著的系统不确定性。由于驱动程序和订单数量庞大,观察空间也随之扩大,尽管订单分配从本质上是一个集中任务,却常被采用多主体强化学习(Multi-Agent Reinforcement Learning, MARL)来解决。然而,独立的MARL方法无法捕获全局信息,导致工人的合作表现差;而集中训练分布执行(Centralized Training Decentralized Execution, CTDE)MARL方法则受制于维度灾难。为克服这些挑战,我们提出了Triple-BERT,一种专为大规模叫车平台订单分配设计的集中单智能体强化学习(MARL)方法。基于变体TD3,我们的方法通过一种动作分解策略将联合动作概率分解为单个司机动作概率,以解决庞大的动作空间。为处理广泛的观察空间,我们引入一种新颖的BERT网络,参数共享机制缓解了随着司机和订单数量增加而带来的参数增长,注意力机制有效捕捉了大量司机和订单之间的复杂关系。我们使用来自曼哈顿的真实叫车数据进行验证。Triple-BERT相对于当前最先进的方法实现了约11.95%的改进,服务订单增加4.26%, pickup时间缩减22.25%。我们的代码、训练好的模型参数和处理后的数据已公开于仓库https://github.com/RS2002/Triple-BERT 中。
引用
@article{arxiv.2510.03257,
title = {Triple-BERT: Do We Really Need MARL for Order Dispatch on Ride-Sharing Platforms?},
author = {Zijian Zhao and Sen Li},
journal= {arXiv preprint arXiv:2510.03257},
year = {2026}
}