中文

合作多智能体强化学习中的随机探索

机器学习 2025-03-04 v2 机器学习

摘要

我们提出了第一个关于在合作多智能体强化学习(MARL)中进行可证明高效随机探索的研究。我们提出了一个用于随机探索的统一算法框架,用于平行马尔可夫决策过程(MDPs),以及两个采用扰动历史探索(PHE)策略和拉普拉斯蒙特卡尔探索(LMC)策略的 Thompson 采样(TS)类型算法,CoopTS-PHE 和 CoopTS-LMC,分别灵活设计且易于在实践中实现。对于过渡为(近似)线性的平行 MDPs 的一类特殊情况,我们理论上证明,CoopTS-PHE 和 CoopTS-LMC 均实现了 O~(d3/2H2MK)\widetilde{\mathcal{O}}(d^{3/2}H^2\sqrt{MK}) 警戒上限,其中 dd 为特征维度,HH 为时隙长度,MM 为智能体数量,KK 为剂集数。这是一个关于合作 MARL 中随机探索的第一个理论结果。我们在多个平行 RL 环境中评估了所提出的方法,包括一个深入探索问题(即 NN-chain)、一个视频游戏以及能源系统中的一个真实问题。我们的实验结果支持我们的框架能够在过度指定的转移模型条件下实现更好的性能。此外,我们在联邦学习的实际应用之间建立了联系。

关键词

引用

@article{arxiv.2404.10728,
  title  = {Randomized Exploration in Cooperative Multi-Agent Reinforcement Learning},
  author = {Hao-Lun Hsu and Weixin Wang and Miroslav Pajic and Pan Xu},
  journal= {arXiv preprint arXiv:2404.10728},
  year   = {2025}
}

备注

66 pages, 14 figures, 6 table. Hao-Lun Hsu and Weixin Wang contributed equally to this work. Published in Proc. of the 38th Conference on Advances in Neural Information Processing Systems (NeurIPS 2024)