RL-MSA: 一种基于强化学习的多线路公交调度方法
机器学习
2024-03-12 v1 人工智能
摘要
多线路公交调度问题 (MLBSP) 对于节省公交公司的运营成本和保障乘客的服务质量至关重要。现有方法通常以离线方式生成公交调度方案,然后根据该方案调度公交车。在实践中,交通拥堵等不确定事件频繁发生,可能使预先确定的公交调度方案变得不可行。在本文中,MLBSP 被建模为马尔可夫决策过程 (MDP)。提出了一种基于强化学习的多线路公交调度方法 (RL-MSA),用于离线和在线阶段的公交调度。在离线阶段,首次将调车决策整合到公交选择决策中,以简化学习问题。在在线阶段,基于离线阶段学习到的策略,通过时间窗机制做出调车决策。我们开发了若干新颖且有用的状态特征,包括控制点、公交线路和公交车的特征。发明了公交优先筛选机制来构建与公交相关的特征。考虑到公交公司和乘客双方的利益,设计了一个结合最终奖励和逐步奖励的奖励函数。离线阶段的实验表明,与离线优化方法相比,RL-MSA 减少了使用的公交车数量。在在线阶段,RL-MSA 能够覆盖时刻表中的所有发车时间(即服务质量),而无需增加使用的公交车数量(即运营成本)。
引用
@article{arxiv.2403.06466,
title = {RL-MSA: a Reinforcement Learning-based Multi-line bus Scheduling Approach},
author = {Yingzhuo Liu},
journal= {arXiv preprint arXiv:2403.06466},
year = {2024}
}