中文

基于强化学习的序列路径推荐与系统最优交通分配

人工智能 2025-05-28 v1

摘要

现代导航系统和共享出行平台越来越依赖个性化路径推荐来改善个人出行体验和运营效率。然而,一个关键问题依然存在:这种序列化、个性化的路径决策能否共同导向系统最优(SO)交通分配?本文通过提出一个基于学习的框架来解决这个问题,该框架将静态 SO 交通分配问题重新表述为单智能体深度强化学习(RL)任务。当起讫点(OD)需求到达时,中央智能体按顺序向出行者推荐路径,以最小化系统总行程时间。为了提高学习效率和求解质量,我们开发了一种 MSA 引导的深度 Q 学习算法,将传统交通分配方法的迭代结构整合到 RL 训练过程中。所提出的方法在 Braess 和 Ortuzar-Willumsen(OW)网络上进行了评估。结果表明,RL 智能体在 Braess 网络中收敛于理论 SO 解,在 OW 网络中仅实现 0.35% 的偏差。进一步的消融研究表明,路径动作集的设计显著影响收敛速度和最终性能,其中基于 SO 信息的路径集带来了更快的学习速度和更好的结果。这项工作提供了一种理论基础扎实且具有实际意义的方法,通过基于学习的序列分配将个体路径行为与系统级效率联系起来。

关键词

引用

@article{arxiv.2505.20889,
  title  = {Reinforcement Learning-based Sequential Route Recommendation for System-Optimal Traffic Assignment},
  author = {Leizhen Wang and Peibo Duan and Cheng Lyu and Zhenliang Ma},
  journal= {arXiv preprint arXiv:2505.20889},
  year   = {2025}
}