中文

面向多智能体强化学习的信息导向抽样算法

信息论 2024-05-01 v1 机器学习 多智能体系统 math.IT 机器学习

摘要

本工作设计并分析了一套新型的多智能体强化学习 (MARL) 算法,基于信息导向抽样 (IDS) 原则。这些算法灵感来自信息论中的基本概念,已在诸如两人零和马尔可夫游戏 (MG) 和多玩家一般和 MG 等 MARL 场景中被证明具有样本效率。对于 episodic 两人零和 MG,我们提出了三个高效的学习纳什均衡算法。基本算法称为 MAIDS,采用非对称学习结构,其中 max 玩家首先基于联合策略的联合信息比率求解 minimax 优化问题,随后 min 玩家固定 max 玩家的策略后最小化边际信息比率。理论分析表明,它对于 K 个回合的贝叶斯遗憾具有 tilde{O}(sqrt{K}) 阶。为降低 MAIDS 的计算负担,我们开发了改进算法 Reg-MAIDS,其在保持相同贝叶斯遗憾界的同时拥有更低的计算复杂度。此外,利用 IDS 原则在选择学习目标方面的灵活性,我们提出两种基于率失真理论构建压缩环境的方法,基于此开发了算法 Compressed-MAIDS,其学习目标为压缩环境。最后,我们将 Reg-MAIDS 扩展到多玩家一般和 MG,证明其以样本高效的方式学习纳什均衡或粗糙相关均衡。

关键词

引用

@article{arxiv.2404.19292,
  title  = {Provably Efficient Information-Directed Sampling Algorithms for Multi-Agent Reinforcement Learning},
  author = {Qiaosheng Zhang and Chenjia Bai and Shuyue Hu and Zhen Wang and Xuelong Li},
  journal= {arXiv preprint arXiv:2404.19292},
  year   = {2024}
}