基于多智能体强化学习的驾驶员重新定位奖励设计
机器学习
2020-08-25 v3 多智能体系统
机器学习
摘要
据报道,很大一部分乘客请求未得到服务,部分原因是巡游的空驶预约车辆在寻客过程中的巡航行为。本文旨在通过捕捉多个智能体之间竞争的均值场多智能体强化学习(MARL)方法对多驾驶员重新定位任务进行建模。由于在给定的奖励机制下将 MARL 直接应用于多驾驶员系统,很可能因驾驶员的自私性而产生次优均衡,本研究提出了一种奖励设计方案,可借此达到更理想的均衡。为有效求解上层为奖励设计、下层为多智能体系统的双层优化问题,采用贝叶斯优化(BO)算法来加速学习过程。随后我们将该双层优化模型应用于两个案例研究,即服务费下的网约车驾驶员重新定位,以及纽约市拥堵收费下的多类别出租车驾驶员重新定位。在第一个案例研究中,BO 得出的派生最优控制与分析解得出的最优控制一致,从而验证了模型。通过简单的分段线性服务费,网约车平台的目标可提高 8.4%。在第二个案例研究中,使用 BO 求解出 $5.1 的最优通行费,与无任何通行费相比,使城市规划者的目标提高了 7.9%。在该最优通行费下,纽约市中央商务区的出租车数量减少,表明交通状况改善,且未大幅加剧地铁系统的拥挤程度。
引用
@article{arxiv.2002.06723,
title = {Reward Design for Driver Repositioning Using Multi-Agent Reinforcement Learning},
author = {Zhenyu Shou and Xuan Di},
journal= {arXiv preprint arXiv:2002.06723},
year = {2020}
}
备注
28 pages, 20 figures, published in Transportation Research Part C 119 (2020) 102738