Traffic-R1:强化 LLM 为交通信号控制系统带来类人推理
人工智能
2025-10-23 v2
摘要
我们介绍了 Traffic-R1,这是一个由自我探索和迭代强化学习在模拟交通环境中结合专家指导开发的 3B 参数基础模型,具备类人交通信号控制(TSC)推理能力。与传统强化学习和最近的 LLM 方法相比,Traffic-R1 具有三大优势:零样本泛化能力,能够将模型直接迁移到新的道路网络和分布外事件场景,利用内部交通控制策略和推理机制;采用紧凑的 3B 参数设计,支持在面向移动终端的芯片上进行实时推理,实现边缘部署;以及可解释的 TSC 流程,通过通信和异步通信网络实现多路口协调。广泛的基准测试表明,Traffic-R1 在多个指标上均优于强基线和训练密集型 RL 控制器。实际生产中,该模型已管理影响每日超过 55,000 名驾驶员的信号灯,平均排队长度降低了超过 5%,运营人员的工作负担减半。本模型已在 https://huggingface.co/Season998/Traffic-R1 上提供。
引用
@article{arxiv.2508.02344,
title = {Traffic-R1: Reinforced LLMs Bring Human-Like Reasoning to Traffic Signal Control Systems},
author = {Xingchen Zou and Yuhao Yang and Zheng Chen and Xixuan Hao and Yiqi Chen and Chao Huang and Yuxuan Liang},
journal= {arXiv preprint arXiv:2508.02344},
year = {2025}
}