中文

广义框架下自博弈算法的比较

人工智能 2020-06-09 v1 计算机科学与博弈论

摘要

在科学史上,总体性的理论框架使研究者能够超越个人直觉和带有文化偏见的假说。它们有助于验证和复现已有发现,并将相互关联的结果联系起来。自博弈(self-play)的概念尽管在多智能体强化学习中常被引用,却从未建立在形式化模型之上。我们提出一个具有明确定义假设的正式框架,它从各种现有自博弈算法中抽象出自我博弈的含义。该框架被构建为多智能体训练理论解概念的一种近似。在一个简单环境中,我们定性地衡量了所捕获的部分自博弈方法在与著名的 PPO 算法结合时对该解的近似程度。我们还提供了关于解释自博弈训练性能量化指标的见解。我们的结果表明,在整个训练过程中,不同的自博弈定义呈现出循环的策略演化。

关键词

引用

@article{arxiv.2006.04471,
  title  = {A Comparison of Self-Play Algorithms Under a Generalized Framework},
  author = {Daniel Hernandez and Kevin Denamganai and Sam Devlin and Spyridon Samothrakis and James Alfred Walker},
  journal= {arXiv preprint arXiv:2006.04471},
  year   = {2020}
}