中文

自我对弈催生鲁棒性

机器学习 2025-02-06 v1 人工智能 机器人学

摘要

自我对弈已推动了两人游戏和多人游戏中的突破性进展。这里我们展示,自我对弈在另一个领域同样有效。我们展示,通过在模拟器中进行规模巨大的自我对弈(1.6 万亿公里驾驶),鲁棒且自然的驾驶行为得以实现。这一进展得益于 Gigaflow,这是一个能够在单个 8-GPU 节点上每小时合成和训练 42 年主观驾驶经验的批量模拟器。所得策略在三个独立的自动驾驶基准测试中实现了最先进的性能。该策略在测试记录的真实场景中、在人类驾驶员之间测试时,超过了先前的最先进水平,而在训练期间从未看到人类数据。该策略在人类参考标准下的表现是真实的,并实现了前所未有的鲁棒性,在模拟器中平均每 17.5 年发生一次事故。

关键词

引用

@article{arxiv.2502.03349,
  title  = {Robust Autonomy Emerges from Self-Play},
  author = {Marco Cusumano-Towner and David Hafner and Alex Hertzberg and Brody Huval and Aleksei Petrenko and Eugene Vinitsky and Erik Wijmans and Taylor Killian and Stuart Bowers and Ozan Sener and Philipp Krähenbühl and Vladlen Koltun},
  journal= {arXiv preprint arXiv:2502.03349},
  year   = {2025}
}