去中心化一般和马尔可夫博弈中的可证明高效强化学习
机器学习
2022-02-01 v3 人工智能
多智能体系统
摘要
本文通过去中心化多智能体强化学习解决了在一般和马尔可夫博弈中高效学习均衡的问题。鉴于计算纳什均衡 (NE) 的根本困难,我们转而寻求找到粗相关均衡 (CCE),这是一种通过允许智能体策略间可能存在相关性而推广 NE 的解概念。我们提出了一种算法,其中每个智能体独立运行乐观 V-learning(Q-learning 的一种变体)以高效探索未知环境,同时使用稳定化的在线镜像下降 (OMD) 子程序进行策略更新。我们表明,智能体至多可在 轮 episode 内找到 -近似 CCE,其中 为状态数, 为最大个体动作空间的大小, 为 episode 的长度。这似乎是首个针对一般一般和马尔可夫博弈学习的样本复杂度结果。我们的结果依赖于对具有动态学习率和加权遗憾的 OMD 的任意时刻高概率遗憾界的新颖研究,这本身具有独立意义。我们算法的一个关键特征是它是完全\emph{去中心化}的,即每个智能体仅能访问其本地信息,且完全不知晓其他智能体的存在。由此,我们的算法可轻松扩展到任意数量的智能体,而无需承受随智能体数量指数增长的开销。
引用
@article{arxiv.2110.05682,
title = {Provably Efficient Reinforcement Learning in Decentralized General-Sum Markov Games},
author = {Weichao Mao and Tamer Başar},
journal= {arXiv preprint arXiv:2110.05682},
year = {2022}
}