中文

用于动态单车重平衡的单策略与双策略强化学习

机器学习 2025-11-27 v2 最优化与控制

摘要

共享单车系统 (BSS) 提供了一种可持续的城市交通解决方案,但要确保其可靠性,需要有效的重平衡策略来应对随机需求并防止站点失衡。本文针对多车辆动态重平衡问题提出了强化学习 (RL) 算法,引入并比较了两种 RL 方法:单策略 RL 和双策略 RL。我们将此网络优化问题表述为连续时间框架下的马尔可夫决策过程,允许车辆在没有同步约束的情况下做出独立且协作的重平衡决策。在第一种方法中,训练一个单一的深度 Q 网络 (DQN) 来联合学习库存和路径决策。第二种方法将节点级的库存决策与弧线级的车辆路径解耦,从而提高了学习效率和适应性。开发了一个遵循先到先服务规则的高保真模拟器,以估计在受时间和天气变化影响的多样化需求场景下的奖励。大量实验表明,虽然单策略模型在多个基准测试中具有竞争力,但双策略模型显著减少了损失需求。这些发现为共享单车运营商提供了宝贵的见解,增强了 RL 在实时重平衡中的潜力,并为更具适应性和智能的城市交通解决方案铺平了道路。

关键词

引用

@article{arxiv.2402.03589,
  title  = {Single- vs. Dual-Policy Reinforcement Learning for Dynamic Bike Rebalancing},
  author = {Jiaqi Liang and Defeng Liu and Sanjay Dominik Jena and Andrea Lodi and Thibaut Vidal},
  journal= {arXiv preprint arXiv:2402.03589},
  year   = {2025}
}