中文

基于多目标强化学习的无桩公共自行车系统动态调度

人工智能 2021-01-20 v1 机器学习

摘要

作为新一代公共自行车系统(PBS),无桩PBS(DL-PBS)是信息物理系统和智能交通的重要应用。如何利用AI基于动态自行车租赁需求提供高效的自行车调度方案是DL-PBS的关键问题。本文中,我们提出一种基于多目标强化学习的动态自行车调度算法(MORL-BD),为DL-PBS提供最优自行车调度方案。我们从CPS的角度对DL-PBS系统建模,并使用深度学习预测自行车停车点布局和自行车调度的动态需求。我们通过考虑调度成本、调度卡车初始负载、卡车间工作负载平衡以及自行车供需动态平衡等优化目标,将多路线自行车调度问题定义为多目标优化问题。在此基础上,多调度卡车间的协同多路线自行车调度问题被建模为多智能体MORL模型。所有停车点之间的调度路径被定义为状态空间,调度成本倒数被定义为奖励。每辆调度卡车配备一个智能体,以在动态DL-PBS网络中学习最优调度路径。我们创建精英列表存储每次动作中发现的自行车调度路径的帕累托最优解,并最终得到帕累托前沿。在实际DL-PBS系统上的实验结果表明,与现有方法相比,MORL-BD能以更短执行时间找到更高质量的帕累托前沿。

关键词

引用

@article{arxiv.2101.07437,
  title  = {Dynamic Bicycle Dispatching of Dockless Public Bicycle-sharing Systems using Multi-objective Reinforcement Learning},
  author = {Jianguo Chen and Kenli Li and Keqin Li and Philip S. Yu and Zeng Zeng},
  journal= {arXiv preprint arXiv:2101.07437},
  year   = {2021}
}