中文

在动态博弈中融合数据驱动先验

机器人学 2024-07-09 v3 人工智能 系统与控制 系统与控制 最优化与控制

摘要

随着自动驾驶汽车等智能机器人在有人存在的环境中部署日益增多,这些系统在多大程度上应利用基于模型的博弈论规划器与数据驱动策略来进行安全、交互感知的运动规划,仍然是一个悬而未决的问题。现有的动态博弈公式假设所有代理都是任务驱动且表现最优的。然而,在现实中,人类倾向于偏离这些模型规定的决策,他们的行为在噪声理性范式下能得到更好的近似。在这项工作中,我们调查了一种原则性的方法论,将数据驱动参考策略与基于优化的博弈论策略相融合。我们提出了 KLGame,这是一种求解非合作动态博弈的算法,其相对于一般的、随机的且可能是多模态的参考策略进行了 Kullback-Leibler (KL) 正则化。我们的方法为每个决策者 Incorporate 了一个可调参数,允许在任务驱动和数据驱动行为之间进行调节。我们提出了一种高效算法,用于实时计算 KLGame 的多模态近似反馈 Nash 均衡策略。通过一系列模拟和现实世界的自动驾驶场景,我们证明了与未正则化的基线相比,KLGame 策略可以更有效地结合参考策略的指导并解释噪声理性的人类行为。包含更多信息、视频和代码的网站:https://kl-games.github.io/。

关键词

引用

@article{arxiv.2402.14174,
  title  = {Blending Data-Driven Priors in Dynamic Games},
  author = {Justin Lidard and Haimin Hu and Asher Hancock and Zixu Zhang and Albert Gimó Contreras and Vikash Modi and Jonathan DeCastro and Deepak Gopinath and Guy Rosman and Naomi Ehrich Leonard and María Santos and Jaime Fernández Fisac},
  journal= {arXiv preprint arXiv:2402.14174},
  year   = {2024}
}

备注

20 pages, 12 figures