中文

面向城市级电动汽车网约车的动作可行性保证半马尔可夫强化学习

人工智能 2026-04-29 v1

摘要

我们研究了城市级电动汽车(EV)网约车车队的控制问题,其中调度、重定位和充电决策必须在不确定且空间相关的需求与行驶时间下遵守充电机和馈线限制。我们将该问题表述为具有混合动作(用于服务、重定位和充电的离散动作,以及连续的充电功率)和可变动作持续时间的六边形网格半马尔可夫决策过程(semi-MDP)。为了保证在训练和部署期间的物理可行性,策略在一个掩码、退火温度的执行器产生的高层意图上进行学习。这些意图在每个决策步骤中通过一个限时滚动混合整数线性规划(MILP)进行投影,该规划严格执行荷电状态、端口和馈线约束。为了缓解分布偏移,我们利用图对齐的 Mahalanobis 基础度量(捕捉空间相关性),针对 Wasserstein-1 模糊集优化一个 Soft Actor--Critic (SAC) 智能体。鲁棒备份使用 Kantorovich--Rubinstein 对偶、投影次梯度内循环和原始--对偶风险预算更新。我们的架构结合了一个双层图卷积网络(GCN)编码器、双评论家和驱动对抗者的价值网络。在基于纽约市出租车数据构建的大规模 EV 车队模拟器上的实验表明,PD--RSAC 实现了最高的净利润,达到 122 万美元,而强大的启发式、单智能体 RL 和多智能体 RL 基线(包括 Greedy、SAC、MAPPO 和 MADDPG)仅为 58 万至 70 万美元,同时保持零馈线限制违规。

关键词

引用

@article{arxiv.2604.25848,
  title  = {Semi-Markov Reinforcement Learning for City-Scale EV Ride-Hailing with Feasibility-Guaranteed Actions},
  author = {An Nguyen and Hoang Nguyen and Phuong Le and Hung Pham and Cuong Do and Laurent El Ghaoui},
  journal= {arXiv preprint arXiv:2604.25848},
  year   = {2026}
}

备注

13 pages, 9 figures. Submitted to Neurocomputing