利用者的力量:大状态空间中可证明的多智能体强化学习
机器学习
2021-10-14 v2 人工智能
机器学习
摘要
现代强化学习(RL)通常涉及具有大状态空间的实际问题,其中必须部署函数近似来近似价值函数或策略。尽管近期 RL 理论进展解决了一系列具有通用函数近似的 RL 问题,但此类成功大多局限于单智能体设定。如何将这些结果扩展到多智能体 RL 仍不明朗,尤其是由于其博弈论本质所产生的新挑战。本文考虑两人零和马尔可夫博弈(MGs)。我们提出一种新算法,能以多项式数量的样本可证明地找到纳什均衡策略,适用于任何具有低多智能体 Bellman-Eluder 维的 MG——这是一种改编自其单智能体版本(Jin et al., 2021)的新复杂度度量。我们新算法的关键组成部分是利用者(exploiter),它通过刻意利用主玩家的弱点来促进主玩家的学习。我们的理论框架是通用的,适用于广泛模型,包括但不限于表格型 MGs、具有线性或核函数近似的 MGs,以及具有丰富观测的 MGs。
引用
@article{arxiv.2106.03352,
title = {The Power of Exploiter: Provable Multi-Agent RL in Large State Spaces},
author = {Chi Jin and Qinghua Liu and Tiancheng Yu},
journal= {arXiv preprint arXiv:2106.03352},
year = {2021}
}