基于奖励引导保守Q学习的乘车拼车与公共交通协调:离线训练与在线微调的强化学习框架
机器学习
2025-01-27 v1 人工智能
新兴技术
摘要
本文提出一种新颖的强化学习(RL)框架,称为奖励引导保守Q学习(RG-CQL),用于增强乘车拼车与公共交通在多模式交通网络中的协调。我们将每个乘车拼车车辆建模为受马尔可夫决策过程(MDP)控制的智能体,并提出一种离线训练与在线微调的RL框架,以提高多模式交通系统(包括乘客-车辆匹配、乘客下车位置选择和车辆路径决策)的数据效率。在离线训练阶段,我们开发了保守深度Q网络(CDDQN)作为动作执行器,以及基于监督学习的奖励估计器,称为引导网络,用于从数据批次中提取动作-奖励关系的有价值见解。在在线微调阶段,引导网络作为探索指南,帮助CDDQN在有效且保守地探索未知状态-动作对方面发挥作用。我们通过使用曼哈顿的真实世界数据进行的现实案例研究证明了该算法的有效性。我们显示, 将乘车拼车与公共交通集成优于两种基准情况(单独乘车与公交协调,以及不进行公交协调的乘车拼车)在系统奖励方面分别提高了17%和22%。此外,我们创新的离线训练与在线微调框架相对于传统在线RL方法在数据效率方面实现了惊人的81.3%的提高,总体奖励增加4.3%,并将过度估计误差降低5.6%。实验结果进一步表明,RG-CQL有效地解决了在大规模集成了公共交通的乘车拼车系统中从离线到在线RL的挑战。
引用
@article{arxiv.2501.14199,
title = {Coordinating Ride-Pooling with Public Transit using Reward-Guided Conservative Q-Learning: An Offline Training and Online Fine-Tuning Reinforcement Learning Framework},
author = {Yulong Hu and Tingting Dong and Sen Li},
journal= {arXiv preprint arXiv:2501.14199},
year = {2025}
}