中文

世界模型作为对手:用于鲁棒运动规划的多智能体自博弈微调

机器人学 2026-07-12 v1 人工智能

摘要

在密集交通中的鲁棒运动规划要求自动驾驶车辆在自然驾驶数据中代表性不足的罕见和安全关键场景中进行交互。虽然对抗训练提供了一种可行的解决方案,但现有方法通常依赖外部场景生成器、启发式扰动或模拟器密集型回放,这使得它们难以与现代自回归规划器集成。在这里,我们将对抗鲁棒规划器学习视为一个受约束的极小极大博弈,并提出了对抗世界建模(AWM),一个理论上 grounded 的多智能体自博弈微调框架。由于求解精确博弈是不可行的,AWM引入了一个有原则的分解求解器。在内部最小化中,规划器的预测世界模型被转换为一个角色条件对手,通过反事实信用分配学习稀疏的、场景自适应的攻击联盟。在外部最大化中,自我规划器针对冻结的AWM优化一个后悔感知的鲁棒最佳响应,利用尾部风险加权和参考锚定信任区域来改善困难案例恢复,同时保持标称驾驶行为。在nuPlan和InterPlan基准上的实验表明,我们的方法生成了可迁移的对抗交互,并产生了一个鲁棒的规划器,在标称和高度交互的长尾场景中都实现了有竞争力的闭环性能。理论分析证明了分解求解器和主要优化组件的合理性。

关键词

引用

@article{arxiv.2607.10630,
  title  = {World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning},
  author = {Tong Nie and Yuewen Mei and Junlin He and Yihong Tang and Jian Sun and Wei Ma},
  journal= {arXiv preprint arXiv:2607.10630},
  year   = {2026}
}