中文

基于仿真信息强化学习的大规模按需拼车系统的非回顾性匹配与再平衡

机器学习 2025-10-31 v1 人工智能 计算机与社会

摘要

拼车(ride-pooling),也称为拼车共享、共享乘车或微型公交,是一个乘客共享乘车的服务。该服务可以为乘客和运营商节省成本,并减少交通拥堵和环境影响。一个关键限制是其回顾性决策,忽略了调度决策的长期影响。为此,我们提出了一种仿真信息强化学习(RL)方法。虽然 RL 在乘车系统中被广泛研究,但在拼车系统中的应用相对较少探索。在本研究中,我们将 Xu 等人(2018)的学习和规划框架从乘车扩展到拼车,通过在学习机制中嵌入拼车仿真以实现非回顾性决策。此外,我们提出了一种补充的再平衡空闲车辆策略。通过在仿真经验上使用 n 步时序差学习,我们推导出时空状态价值,并随后评估非回顾性策略的有效性,使用纽约出租车请求数据。结果表明,非回顾性匹配策略相对于回顾性策略可将服务率提高最高 8.4%,同时降低乘客的车内时间和等待时间。此外,所提出的非回顾性策略可将 fleet 大小降低 25% 以上,同时保持相同的性能水平,从而为运营商提供了显著的成本节省。将再平衡操作纳入所提框架可将等待时间降低最高 27.3%、车内时间降低 12.5%,并将服务率提高 15.1%,但乘客的车辆行驶里程会增加。

关键词

引用

@article{arxiv.2510.25796,
  title  = {Non-myopic Matching and Rebalancing in Large-Scale On-Demand Ride-Pooling Systems Using Simulation-Informed Reinforcement Learning},
  author = {Farnoosh Namdarpour and Joseph Y. J. Chow},
  journal= {arXiv preprint arXiv:2510.25796},
  year   = {2025}
}