面向共享单车系统实时再平衡的双策略强化学习
机器学习
2024-06-04 v1
摘要
共享单车系统在缓解交通拥堵和促进健康生活方式方面发挥着关键作用。然而,确保其可靠性和用户接受度需要有效的单车再平衡策略。本研究引入了一种新颖的方法,利用车队解决实时再平衡问题。它采用了一种双策略强化学习算法,将库存和路径决策解耦,与之前同时做出两种决策的方法相比,提高了真实性和效率。我们首先将库存和路径子问题建模为连续时间框架内的多智能体马尔可夫决策过程。随后,我们提出了一个基于DQN的双策略框架来联合估计价值函数,从而最小化需求损失。为了促进学习,我们应用了一个全面的模拟器,该模拟器在“先到先服务”规则下运行,能够计算不同需求场景下的即时奖励。我们在由历史真实数据生成的各种数据集上进行了大量实验,这些数据受时间和天气因素影响。我们提出的算法在性能上显著优于之前的基线方法。它为运营商提供了有价值的实践见解,并进一步探索了将强化学习融入现实世界动态规划问题的方法,为更智能、更稳健的城市出行解决方案铺平了道路。
引用
@article{arxiv.2406.00868,
title = {Dual Policy Reinforcement Learning for Real-time Rebalancing in Bike-sharing Systems},
author = {Jiaqi Liang and Defeng Liu and Sanjay Dominik Jena and Andrea Lodi and Thibaut Vidal},
journal= {arXiv preprint arXiv:2406.00868},
year = {2024}
}