中文

基于R1风格强化微调的多智能体交通仿真

计算机视觉与模式识别 2026-03-03 v2 机器人学

摘要

可扩展且真实的多智能体交通行为仿真是推动自动驾驶技术发展的关键。尽管现有数据驱动的仿真器在这一领域取得了显著进展,但主要依赖监督学习来将仿真分布与真实驾驶情景对齐。然而,存在一种持久的挑战,即在训练和测试之间产生分布偏移,这往往削弱模型在未见环境中的泛化能力。为此,我们提出了SMART-R1,一种针对next-token预测模型的R1风格强化微调范式,旨在更好地将智能体行为与人类偏好和评估指标对齐。我们的方法引入了一种以指标为导向的策略优化算法以改进分布对齐,并提出了一种迭代的SFT-RFT-SFT训练策略,在监督微调(SFT)和强化微调(RFT)之间交替,以最大化性能收益。在大规模Waymo Open Motion Dataset(WOMD)上的大量实验验证了该简单而强大的R1风格训练框架在提升基础模型方面的有效性。Waymo Open Sim Agents Challenge(WOSAC)上的结果显示,SMART-R1以0.7858的整体真实性 meta 分数实现了最先进的性能,在提交时排名第一。

关键词

引用

@article{arxiv.2509.23993,
  title  = {Advancing Multi-agent Traffic Simulation via R1-Style Reinforcement Fine-Tuning},
  author = {Muleilan Pei and Shaoshuai Shi and Shaojie Shen},
  journal= {arXiv preprint arXiv:2509.23993},
  year   = {2026}
}

备注

Accepted by ICLR 2026