中文

机器中的目的:交通仿真器是否为强化学习应用产生分布等价的结果?

机器学习 2025-04-18 v1 计算工程、金融与科学

摘要

交通仿真器被用于为智能交通系统(ITSs)中的学习生成数据。一个关键问题是,其建模假设在多大程度上影响了 ITSs 在真实世界部署时适应各种场景的能力。本工作聚焦于两个常用于训练交通应用强化学习(RL)智能体的仿真器 CityFlow 和 SUMO。一项改变驾驶员行为与仿真规模的受控虚拟实验发现了反对这些仿真器在 RL 相关度量上具有分布等价性的证据,所有评估度量的均方根误差和 KL 散度均显著大于 0。尽管细粒度的真实世界验证通常仍不可行,这些发现表明交通仿真器并非 RL 训练的意外救星(deus ex machina):理解仿真器间差异的影响对于训练和部署基于 RL 的 ITSs 是必要的。

关键词

引用

@article{arxiv.2311.08429,
  title  = {Purpose in the Machine: Do Traffic Simulators Produce Distributionally Equivalent Outcomes for Reinforcement Learning Applications?},
  author = {Rex Chen and Kathleen M. Carley and Fei Fang and Norman Sadeh},
  journal= {arXiv preprint arXiv:2311.08429},
  year   = {2025}
}

备注

12 pages; accepted version, published at the 2023 Winter Simulation Conference (WSC '23)