中文

利用者的力量:大状态空间中可证明的多智能体强化学习

机器学习 2021-10-14 v2 人工智能 机器学习

摘要

现代强化学习(RL)通常涉及具有大状态空间的实际问题,其中必须部署函数近似来近似价值函数或策略。尽管近期 RL 理论进展解决了一系列具有通用函数近似的 RL 问题,但此类成功大多局限于单智能体设定。如何将这些结果扩展到多智能体 RL 仍不明朗,尤其是由于其博弈论本质所产生的新挑战。本文考虑两人零和马尔可夫博弈(MGs)。我们提出一种新算法,能以多项式数量的样本可证明地找到纳什均衡策略,适用于任何具有低多智能体 Bellman-Eluder 维的 MG——这是一种改编自其单智能体版本(Jin et al., 2021)的新复杂度度量。我们新算法的关键组成部分是利用者(exploiter),它通过刻意利用主玩家的弱点来促进主玩家的学习。我们的理论框架是通用的,适用于广泛模型,包括但不限于表格型 MGs、具有线性或核函数近似的 MGs,以及具有丰富观测的 MGs。

关键词

引用

@article{arxiv.2106.03352,
  title  = {The Power of Exploiter: Provable Multi-Agent RL in Large State Spaces},
  author = {Chi Jin and Qinghua Liu and Tiancheng Yu},
  journal= {arXiv preprint arXiv:2106.03352},
  year   = {2021}
}