匹配时机把握:用于网约车与拼车服务的深度强化学习方法
机器学习
2025-03-18 v1 人工智能
摘要
网约车匹配中的高效时机把握对于提高网约车和拼车服务的性能至关重要,因为它决定了每次匹配过程中考虑的司机和乘客数量。传统的批量匹配方法通常使用固定的时间间隔来累积乘车请求,然后再分配匹配。虽然这种方法增加了可供匹配的司机和乘客数量,但它无法适应实时的供需波动,通常会导致乘客等待时间延长和司机空闲期增加。为了解决这一局限性,我们提出了一种使用深度强化学习(RL)的自适应网约车匹配策略,以根据实时系统条件动态确定何时执行匹配。与固定间隔方法不同,我们的方法持续评估系统状态,并在最小化乘客总等待时间的时刻执行匹配。此外,我们引入了基于势函数的奖励塑形(PBRS)机制来缓解稀疏奖励,加速 RL 训练并提高决策质量。使用基于真实世界数据训练的真实模拟器进行的大量实证评估表明,我们的方法优于固定间隔匹配策略,显著减少了乘客等待时间和绕道延误,从而提高了网约车和拼车系统的整体效率。
引用
@article{arxiv.2503.13200,
title = {Timing the Match: A Deep Reinforcement Learning Approach for Ride-Hailing and Ride-Pooling Services},
author = {Yiman Bao and Jie Gao and Jinke He and Frans A. Oliehoek and Oded Cats},
journal= {arXiv preprint arXiv:2503.13200},
year = {2025}
}