中文

将对手塑形扩展到高维博弈

人工智能 2024-02-13 v3

摘要

在具有混合动机的多智能体环境中,为零和博弈开发的方法已被证明会导致不利结果。为解决这一问题,对手塑形(OS)方法显式地学习影响共玩者的学习动态,并在经验上导致个体和集体结果的改善。然而,由于估计高阶导数或扩展无模型元学习的挑战,OS方法仅在低维环境中进行了评估。能够扩展到更复杂设置的替代方法要么收敛到不理想的解,要么依赖于关于环境或共玩者的不切实际假设。在本文中,我们首次成功地将基于OS的方法扩展到具有时间扩展动作和长时间跨度的广义和博弈。在分析了先前算法使用的元状态和历史表示之后,我们提出了一个简化版本,称为Shaper。我们通过实验表明,Shaper在文献中的一系列具有挑战性的设置中导致了个体和集体结果的改善。我们进一步形式化了文献中先前隐含的一种技术,并分析了它对对手塑形的贡献。我们通过实验表明,该技术有助于先前方法在某些环境中的运作。最后,我们表明先前的环境,如CoinGame,不适合分析时间扩展的广义和交互。

关键词

引用

@article{arxiv.2312.12568,
  title  = {Scaling Opponent Shaping to High Dimensional Games},
  author = {Akbir Khan and Timon Willi and Newton Kwan and Andrea Tacchetti and Chris Lu and Edward Grefenstette and Tim Rocktäschel and Jakob Foerster},
  journal= {arXiv preprint arXiv:2312.12568},
  year   = {2024}
}