中文

SPACeR:基于集中参考模型的自我对弈锚定

机器学习 2026-02-26 v2 人工智能 机器人学

摘要

发展自主车辆(AVs)不仅需要安全和效率,还需要实现真实、人类化的行为,这些行为在社交环境下具有感知性。实现这一目标需要sim代理策略具有人类化、快速且在多代理环境中可扩展。最近的仿照学习进展表明,直接从人类驾驶数据中捕获行为可以产生逼真的策略。然而,这些模型计算昂贵、推理缓慢,且在反应性、闭环场景中难以适应。相比之下,自我对弈强化学习(RL)在规模性方面表现出色,然而它常常依赖于启发式方法和奖励塑造,导致策略偏离人类规范。我们提出SPACeR框架,利用预训练的标记化自回归运动模型作为集中参考策略,以指导非中心化的自我对弈。参考模型提供似然奖励和KL散度,将策略锚定在人类驾驶分布中,同时保持RL的可扩展性。在Waymo Sim Agents挑战中,我们的方法实现了与仿照学习策略相当的性能,同时推理速度快至原来的10倍,参数规模仅为大型生成模型的1/50。此外,我们在闭环ego规划评估任务中展示了sim代理能够有效地进行快速且可扩展的交通仿真,以衡量规划器质量,确立了一种新的自主驾驶策略测试范式。

关键词

引用

@article{arxiv.2510.18060,
  title  = {SPACeR: Self-Play Anchoring with Centralized Reference Models},
  author = {Wei-Jer Chang and Akshay Rangesh and Kevin Joseph and Matthew Strong and Masayoshi Tomizuka and Yihan Hu and Wei Zhan},
  journal= {arXiv preprint arXiv:2510.18060},
  year   = {2026}
}

备注

Accepted at ICLR 2026. Project page: https://spacer-ai.github.io/