面向按需自主出行系统的多智能体深度强化学习全局奖励
机器学习
2024-05-21 v2 多智能体系统
系统与控制
系统与控制
摘要
我们研究按需自主出行(AMoD)系统中的车辆调度问题,其中中央运营商将车辆分配给客户请求或拒绝这些请求,旨在最大化其总利润。近期的方法使用多智能体深度强化学习(MADRL)来实现可扩展且高性能的算法,但基于局部奖励训练智能体,这扭曲了相对于系统整体利润的奖励信号,导致性能下降。因此,我们提出了一种新颖的基于全局奖励的 MADRL 算法,用于 AMoD 系统中的车辆调度,该算法通过利用反事实基线为智能体分配奖励,解决了已训练智能体与运营商之间迄今存在的目标冲突。在真实世界数据上的各种设置中,与使用局部奖励的最先进 MADRL 算法相比,我们的算法表现出统计学上的显著提升。我们进一步提供了结构分析,表明利用全局奖励可以改善隐式车辆平衡与需求预测能力。我们的代码可在 https://github.com/tumBAIS/GR-MADRL-AMoD 获取。
关键词
引用
@article{arxiv.2312.08884,
title = {Global Rewards in Multi-Agent Deep Reinforcement Learning for Autonomous Mobility on Demand Systems},
author = {Heiko Hoppe and Tobias Enders and Quentin Cappart and Maximilian Schiffer},
journal= {arXiv preprint arXiv:2312.08884},
year = {2024}
}
备注
22 pages, 6 figures, extended version of paper accepted at the 6th Learning for Dynamics & Control Conference (L4DC 2024)