基于深度强化学习的动态OD矩阵估计:考虑信用分配问题的微观交通仿真
机器学习
2026-03-26 v2
摘要
本文聚焦于动态origin-destination矩阵估计(DODE),这是微观交通仿真有效应用的关键校准过程。DODE问题在微观仿真中的根本挑战源于复杂的时序动力学和个体车辆动力学的内在不确定性。这使得精确确定哪辆车在任意时刻穿越哪条链路几乎不可能,导致OD矩阵与其对结果链路流量贡献之间存在复杂且常常模糊的关系。这种现象构成了本研究所关注的信用分配问题。我们将DODE问题建模为马尔可夫决策过程(MDP),并提出一种新框架应用无模型深度强化学习(DRL)。在我们提出的框架中,智能体通过与仿真环境直接交互来学习最优策略,以顺序方式生成OD矩阵。该方法通过在 Nguyen-Dupuis 网络上的 toy 实验和实际高速公路子网(Santa Clara 和 San Jose)案例研究进行评估。实验结果表明,我们的方法相对于最佳常规基线可将均方误差(MSE)降低超过20%。通过将DODE重新建模为顺序决策问题,我们的方法通过其学习到的策略解决了信用分配挑战,从而克服了常规方法的局限性,提出了一种用于微观交通仿真校准的新框架。
引用
@article{arxiv.2511.06229,
title = {Deep Reinforcement Learning for Dynamic Origin-Destination Matrix Estimation in Microscopic Traffic Simulations Considering Credit Assignment},
author = {Donggyu Min and Seongjin Choi and Dong-Kyu Kim},
journal= {arXiv preprint arXiv:2511.06229},
year = {2026}
}
备注
16 pages, 13 figures, 7 tables