中文

用于电动自动驾驶出租车调度与充电桩分配的原子近端策略优化

人工智能 2025-04-29 v2

摘要

Waymo 等先驱公司已在多个美国城市部署了自动驾驶出租车服务。这些自动驾驶出租车为电动汽车,其运营需要在随机环境中联合优化乘车匹配、车辆重定位和充电调度。我们将自动驾驶出租车的网约车系统运营建模为具有无限视界的离散时间平均奖励马尔可夫决策过程。随着车队规模的增长,调度变得极具挑战性,因为系统状态空间和车队调度动作空间均随车辆数量呈指数级增长。为解决这一问题,我们引入了一种可扩展的深度强化学习算法,称为原子近端策略优化,该算法利用原子动作分解来缩减动作空间。我们使用真实的纽约市网约车行程记录评估了我们的算法,并通过调度策略实现的长期平均奖励(相对于基于流体的上界)来衡量其性能。我们的实验证明了 Atomic-PPO 相较于基准方法的优越性能。此外,我们进行了广泛的数值实验,以分析充电设施的高效分配,并评估车辆续航里程和充电速度对系统性能的影响。

关键词

引用

@article{arxiv.2502.13392,
  title  = {Atomic Proximal Policy Optimization for Electric Robo-Taxi Dispatch and Charger Allocation},
  author = {Jim Dai and Manxi Wu and Zhanhao Zhang},
  journal= {arXiv preprint arXiv:2502.13392},
  year   = {2025}
}