中文

用于再平衡无桩共享单车系统的深度强化学习框架

人工智能 2018-12-04 v4

摘要

共享单车提供了一种环保的出行方式,并在全球蓬勃发展。然而,由于用户出行模式的高度相似性,单车失衡问题持续发生,尤其对于无桩共享单车系统,对服务质量和公司收入造成显著影响。因此,高效解决此类失衡已成为共享单车系统的关键任务。本文中,我们提出了一种新颖的深度强化学习框架,用于激励用户再平衡此类系统。我们将该问题建模为马尔可夫决策过程,并同时考虑空间和时间特征。我们开发了一种称为分层强化定价(HRP)的新型深度强化学习算法,其构建于深度确定性策略梯度算法之上。与现有常忽略空间信息且严重依赖准确预测的方法不同,HRP 利用带有嵌入式局部模块的分治结构捕捉空间和时间依赖性。我们基于来自中国主要无桩共享单车公司摩拜(Mobike)的数据集进行了大量实验来评估 HRP。结果表明,HRP 的性能接近 24 个时隙的前瞻优化,并在服务水平和单车分布上均优于 SOTA 方法。其在应用于未见区域时也具有良好的迁移性。

关键词

引用

@article{arxiv.1802.04592,
  title  = {A Deep Reinforcement Learning Framework for Rebalancing Dockless Bike Sharing Systems},
  author = {Ling Pan and Qingpeng Cai and Zhixuan Fang and Pingzhong Tang and Longbo Huang},
  journal= {arXiv preprint arXiv:1802.04592},
  year   = {2018}
}