FormulaZero:基于离线群体合成的分布鲁棒在线自适应方法
机器学习
2020-08-25 v2 多智能体系统
机器人学
机器学习
摘要
在多智能体环境中部署自动驾驶车辆时,平衡性能与安全性至关重要。特别地,自动驾驶赛车是一个会惩罚安全但保守策略的领域,凸显了对鲁棒、自适应策略的需求。当前方法要么对其他智能体做简化假设,要么缺乏用于在线自适应的鲁棒机制。本工作在算法层面对这两个挑战均作出贡献。首先,为生成真实且多样的对手集合,我们提出了一种基于副本交换马尔可夫链蒙特卡罗的自博弈新方法。其次,我们提出了一种分布鲁棒bandit优化过程,可依据对对手行为信念的不确定性自适应调整风险厌恶程度。我们严格量化了在实时运动规划中近似这些计算时在性能与鲁棒性之间的权衡,并在达到与一级方程式赛车相当缩放速度的自动驾驶车辆上实验验证了我们的方法。
引用
@article{arxiv.2003.03900,
title = {FormulaZero: Distributionally Robust Online Adaptation via Offline Population Synthesis},
author = {Aman Sinha and Matthew O'Kelly and Hongrui Zheng and Rahul Mangharam and John Duchi and Russ Tedrake},
journal= {arXiv preprint arXiv:2003.03900},
year = {2020}
}
备注
ICML 2020: https://icml.cc/virtual/2020/poster/6277