面向不确定性下的实时系统最优交通路由 -- 物理模型能否提升强化学习?
机器学习
2024-07-11 v1 人工智能
系统与控制
系统与控制
摘要
系统最优交通路由可通过为部分车辆分配路线来缓解拥堵,从而减少交通系统中所有车辆的总旅行时间。然而,由于需求不确定且系统动力学未知,特别是在广泛的交通网络中,实现实时最优路由具有挑战。虽然基于物理模型的方法对不确定性和模型不匹配敏感,但无模型强化学习在学习效率和可解释性方面存在困难。本文提出了 TransRL,一种将强化学习与物理模型集成以提升性能、可靠性和可解释性的新型算法。TransRL 通过建立基于物理模型的确定性政策,从而从中学习并受由可微且随机教师政策所指引。在训练期间,TransRL 旨在最大化累积奖励,同时最小化当前政策与教师政策之间的库尔比-克鲁斯 (KL) 散度。这种方法使 TransRL 能够同时利用与环境的交互以及来自物理模型的见解。我们在三个具有数百个链路的交通网络上进行实验。结果表明,TransRL 在适应实际网络数据方面优于基于交通模型的方法。通过利用物理模型的信息,TransRL 持续优于诸如近端政策优化(PPO) 和软演员-评论家(SAC) 等最先进的强化学习算法。此外,TransRL 的行为在可靠性和可解释性方面优于 PPO 和 SAC 等基线强化学习方法。
引用
@article{arxiv.2407.07364,
title = {Real-time system optimal traffic routing under uncertainties -- Can physics models boost reinforcement learning?},
author = {Zemian Ke and Qiling Zou and Jiachao Liu and Sean Qian},
journal= {arXiv preprint arXiv:2407.07364},
year = {2024}
}