中文

令牌化交通模型的闭环监督微调

机器学习 2025-03-17 v2

摘要

交通仿真旨在学习交通代理的政策,以便在闭环中展开,忠实地恢复在现实世界中观察到的轨迹联合分布。受大型语言模型的启发,最近的令牌化多代理政策在交通仿真中取得了最佳成绩。然而,它们通常通过开放式行为模仿进行训练,因在仿真期间闭环执行时会出现协变量漂移。在本工作中,我们提出了最近的Top-K (CAT-K) 滚动策略,这是一种简单而有效的闭环微调方法,以缓解协变量漂移。CAT-K微调仅需要现有轨迹数据,无需强化学习或生成对抗式模仿。具体而言,CAT-K微调使一个仅需7百万参数的令牌化交通仿真政策能够超过同一模型家族中10200万参数的模型,在提交时期间在Waymo Sim Agent Challenge排行榜中获得第一名。代码可在 https://github.com/NVlabs/catk 获取。

关键词

引用

@article{arxiv.2412.05334,
  title  = {Closed-Loop Supervised Fine-Tuning of Tokenized Traffic Models},
  author = {Zhejun Zhang and Peter Karkus and Maximilian Igl and Wenhao Ding and Yuxiao Chen and Boris Ivanovic and Marco Pavone},
  journal= {arXiv preprint arXiv:2412.05334},
  year   = {2025}
}

备注

CVPR 2025. Project Page: https://zhejz.github.io/catk/