中文

H-TD2:用于自适应城市出租车调度的混合时序差分学习

系统与控制 2021-05-06 v1 机器学习 系统与控制

摘要

我们提出 H-TD2:用于出租车调度的混合时序差分学习(Hybrid Temporal Difference Learning for Taxi Dispatch),这是一种无模型的自适应决策算法,用于在动态城市环境中协调大规模自动驾驶出租车车队,以最小化预期乘客等待时间。我们的可扩展算法利用网约车(transportation network company)的自然拓扑结构,在两种行为间切换:在各出租车本地计算的分布式时序差分学习,以及在调度中心计算的不频繁集中式 Bellman 更新。我们推导了后悔界(regret bound),并设计了两种行为间的触发条件,以显式控制计算复杂度与单车策略有界次优性之间的权衡;这通过实现有界次优性的分布式运行推进了当前技术水平。此外,与近期强化学习调度方法不同,该策略估计具有自适应能力且对训练域外事件鲁棒。这一结果得益于两步建模方法:策略在智能体无关的、基于网格的马尔可夫决策过程(Markov Decision Process)上学习,各出租车在分布式博弈论任务分配中使用所学策略进行协调。我们在 Gridworld 环境中以模拟乘客数据集对照滚动时域控制(receding horizon control)基线验证算法,所提方案在广泛参数范围内将平均乘客等待时间降低 50%。我们还在芝加哥城市环境中使用来自芝加哥出租车公共数据集的真实乘客请求进行验证,在 2016 年美国职业棒球大联盟世界系列赛期间不规则乘客分布下,所提方案将平均乘客等待时间降低 26%。

关键词

引用

@article{arxiv.2105.02138,
  title  = {H-TD2: Hybrid Temporal Difference Learning for Adaptive Urban Taxi Dispatch},
  author = {Benjamin Rivière and Soon-Jo Chung},
  journal= {arXiv preprint arXiv:2105.02138},
  year   = {2021}
}