中文

一种用于非平稳多智能体强化学习的黑盒方法

机器学习 2024-05-06 v2 人工智能 计算机科学与博弈论 多智能体系统 机器学习

摘要

我们研究在非平稳多智能体系统中学习均衡,并解决使多智能体学习区别于单智能体学习的挑战。具体而言,我们关注具有 bandit 反馈的博弈,其中即便待测试的差距很小,测试一个均衡也可能产生显著后悔,且平稳博弈中多个最优解(均衡)的存在带来额外挑战。为克服这些障碍,我们提出一种通用的黑盒方法,当配备用于平稳环境的适当学习与测试预言机时,可适用于广泛的问题,如一般和博弈、势博弈与马尔可夫博弈。我们的算法在由总变差 Δ 度量的非平稳程度已知时可实现 O~(Δ1/4T3/4)\widetilde{O}\left(\Delta^{1/4}T^{3/4}\right) 后悔,在 Δ 未知时可实现 O~(Δ1/5T4/5)\widetilde{O}\left(\Delta^{1/5}T^{4/5}\right) 后悔,其中 TT 为轮数。同时,我们的算法从预言机继承了关于智能体数量的有利依赖。作为一项可能独立有趣的附带贡献,我们展示了如何通过黑盒归约到单智能体学习来测试各类均衡,包括纳什均衡、相关均衡与粗相关均衡。

关键词

引用

@article{arxiv.2306.07465,
  title  = {A Black-box Approach for Non-stationary Multi-agent Reinforcement Learning},
  author = {Haozhe Jiang and Qiwen Cui and Zhihan Xiong and Maryam Fazel and Simon S. Du},
  journal= {arXiv preprint arXiv:2306.07465},
  year   = {2024}
}

备注

26 Pages, 2 figures