中文

非平稳离散时间线性二次平均场博弈中的强化学习

系统与控制 2020-10-02 v3 计算机科学与博弈论 机器学习 系统与控制

摘要

本文研究离散时间线性二次平均场博弈(LQ-MFGs)背景下的大规模多智能体强化学习(RL)。我们的设定不同于大多数现有 MFG 的 RL 工作,在于考虑无限 horizon 上的非平稳 MFG。我们提出一种 actor-critic 算法来迭代计算 LQ-MFG 的平均场均衡(MFE)。有两个主要挑战:i)MFG 的非平稳性导致一个线性二次跟踪问题,需要求解一个反向时间(非因果)方程,而标准(因果)RL 算法无法求解;ii)许多 RL 算法假设状态从马尔可夫链(MC)的平稳分布采样,即链已混合,这一假设对真实数据源不满足。我们首先确定平均场轨迹遵循线性动力学,使问题可重新表述为线性二次高斯问题。在此重构下,我们提出一种允许从未混合 MC 采样的 actor-critic 算法。随后给出算法的有限样本收敛保证。为刻画算法在多智能体 RL 中的性能,我们给出了相对于有限种群博弈纳什均衡的误差界。

关键词

引用

@article{arxiv.2009.04350,
  title  = {Reinforcement Learning in Non-Stationary Discrete-Time Linear-Quadratic Mean-Field Games},
  author = {Muhammad Aneeq uz Zaman and Kaiqing Zhang and Erik Miehling and Tamer Başar},
  journal= {arXiv preprint arXiv:2009.04350},
  year   = {2020}
}

备注

To appear in CDC 2020