中文

DROP:面向最优网约车车辆重定位的深度重定位选项策略

多智能体系统 2021-09-10 v1 人工智能 机器学习

摘要

在网约车系统中,空闲车辆的优化重定位可以显著减少车队闲置时间并平衡供需分布,从而提高系统效率并促进驾驶员满意度和留存率。无模型深度强化学习(DRL)已被证明能够通过与大规模网约车系统中的内在动态积极交互来动态学习重定位策略。然而,稀疏奖励信号以及供需分布不平衡的问题为开发有效的DRL模型设置了关键障碍。传统的探索策略(例如,ϵ\epsilon-贪心策略)在这种环境中可能几乎不起作用,因为车辆会在远离高收入区域的低需求区域抖动。本研究提出了深度重定位选项策略(DROP),该策略监督车辆智能体逃离供过于求的区域,并有效地重定位到潜在的服务不足区域。我们提出学习一个时间扩展重定位图的拉普拉斯嵌入,作为系统重定位策略的近似表示。该嵌入生成与任务无关的信号,这些信号与任务相关信号结合,构成用于生成DROP的伪奖励函数。我们提出了一个分层学习框架,用于训练一个高层重定位策略和一组低层DROP。我们使用一个基于真实世界出行记录数据定制的高保真模拟器验证了该方法的有效性。我们报告称,DROP显著改善了基线模型,每小时收入提高了15.7%,并能有效解决低需求区域的抖动问题。

关键词

引用

@article{arxiv.2109.04149,
  title  = {DROP: Deep relocating option policy for optimal ride-hailing vehicle repositioning},
  author = {Xinwu Qian and Shuocheng Guo and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2109.04149},
  year   = {2021}
}