中文

ADV-0:面向长尾鲁棒性的闭环极小化对抗训练

机器学习 2026-03-17 v1 人工智能

摘要

部署自动驾驶系统需要具备对稀有但安全关键情形的鲁棒性。虽然对抗训练提供了可行的解决方案,但现有方法通常将情景生成与策略优化解耦,并依赖启发式代理。这导致目标错位,无法捕捉演化策略所产生的失效模式的变化。本文提出了ADV-0,一种闭环极小化优化框架,将驾驶策略(防御者)与对抗智能体(攻击者)之间的相互作用视为零和马尔可夫游戏。通过将攻击者的效用直接与防御者的目标对齐,我们揭示了最优对手分布。为使其可计算,我们将动态对手演化建模为迭代偏好学习,高效逼近该最优解,并提供一种对算法agnostic的解决方案。理论上,ADV-0收敛至纳什均衡,并最大化对实际性能的认证下界。实验表明,它有效暴露了多样化的安全关键故障,大幅提升了所学习策略和运动规划器对未见长尾风险的泛化能力。

关键词

引用

@article{arxiv.2603.15221,
  title  = {ADV-0: Closed-Loop Min-Max Adversarial Training for Long-Tail Robustness in Autonomous Driving},
  author = {Tong Nie and Yihong Tang and Junlin He and Yuewen Mei and Jie Sun and Lijun Sun and Wei Ma and Jian Sun},
  journal= {arXiv preprint arXiv:2603.15221},
  year   = {2026}
}