AdaPool:一种基于无模型深度强化学习与变点检测的日间自适应车队管理框架
人工智能
2021-06-15 v2 多智能体系统
摘要
本文介绍了一种自适应无模型深度强化学习方法,能够识别并适应拼车共享出行环境中的日间模式。深度强化学习(RL)由于对经验分布变化的时尺度不可知而遭受灾难性遗忘。尽管 RL 算法保证在马尔可夫决策过程(MDPs)中收敛到最优策略,但这仅在静态环境下成立。然而,该假设非常受限。在许多现实问题如共享出行、交通控制等中,我们面对的是高度动态环境,RL 方法仅能产生次优决策。为缓解高度动态环境中的此问题,我们(1)采用在线狄利克雷变点检测(ODCP)算法检测经验分布的变化,(2)开发能够识别日间模式并根据底层环境变化做出明智调度决策的 Deep Q Network(DQN)智能体。所提方法不是按星期固定模式,而是自动检测 MDP 已改变,并使用新模型的结果。除调度中的自适应逻辑外,本文还提出了一种动态的、需求感知的车辆-乘客匹配与路径规划框架,该框架基于在线需求、车辆容量和位置为每个车辆动态生成最优路线。在纽约市出租车公开数据集上的评估显示了我们的方法在提升车队利用率方面的有效性,其中少于 50% 的车队被用于服务高达 90% 的请求需求,同时最大化利润并最小化空闲时间。
引用
@article{arxiv.2104.00203,
title = {AdaPool: A Diurnal-Adaptive Fleet Management Framework using Model-Free Deep Reinforcement Learning and Change Point Detection},
author = {Marina Haliem and Vaneet Aggarwal and Bharat Bhargava},
journal= {arXiv preprint arXiv:2104.00203},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:2010.01755