中文

面向一般和马尔可夫博弈的PAC强化学习算法

计算机科学与博弈论 2020-09-09 v1 机器学习 最优化与控制

摘要

本文提出了一个用于马尔可夫博弈的 Probably Approximately Correct(PAC,可能近似正确)多智能体强化学习(MARL)算法的理论框架。本文利用延迟 Q-learning 的思想对著名的 Nash Q-learning 算法进行扩展,从而构建了一种面向一般和马尔可夫博弈的新型 PAC MARL 算法。除指导设计可证明为 PAC 的 MARL 算法外,该框架还可用于检验任意 MARL 算法是否为 PAC。对比数值结果展示了其性能与鲁棒性。

关键词

引用

@article{arxiv.2009.02605,
  title  = {PAC Reinforcement Learning Algorithm for General-Sum Markov Games},
  author = {Ashkan Zehfroosh and Herbert G. Tanner},
  journal= {arXiv preprint arXiv:2009.02605},
  year   = {2020}
}