中文

论无模型学习在平均场博弈中的收敛性

最优化与控制 2020-02-24 v3 机器学习 机器学习

摘要

在多智能体系统(MAS)中通过经验学习是一项困难而令人振奋的任务,因为环境非平稳,其动态随着群体学习而演化。为了为具有大量交互智能体的系统(例如群体)设计可扩展算法,本文关注平均场多智能体系统,其中智能体数量渐近无穷。近来,一个非常活跃的新兴领域研究在平稳平均场博弈(MFG)中无先验信息的智能体使用各类强化学习算法的效果,并通过重复经验学习其策略。我们对此问题采取高层次的视角,并在完全一般性下分析在每步使用任意单智能体学习算法的虚拟迭代格式的收敛性。我们根据每次学习迭代步骤中产生的累积误差,量化所计算的近似纳什均衡的质量。值得注意的是,我们首次展示了无模型学习算法在仅依赖MFG动态经典假设下向非平稳MFG均衡的收敛。我们用连续动作空间环境中的数值实验说明理论结果,其中迭代虚拟博弈格式的近似最优响应由深度强化学习算法计算。

关键词

引用

@article{arxiv.1907.02633,
  title  = {On the Convergence of Model Free Learning in Mean Field Games},
  author = {Romuald Elie and Julien Pérolat and Mathieu Laurière and Matthieu Geist and Olivier Pietquin},
  journal= {arXiv preprint arXiv:1907.02633},
  year   = {2020}
}