一种用于非平稳多智能体强化学习的黑盒方法
机器学习
2024-05-06 v2 人工智能
计算机科学与博弈论
多智能体系统
机器学习
摘要
我们研究在非平稳多智能体系统中学习均衡,并解决使多智能体学习区别于单智能体学习的挑战。具体而言,我们关注具有 bandit 反馈的博弈,其中即便待测试的差距很小,测试一个均衡也可能产生显著后悔,且平稳博弈中多个最优解(均衡)的存在带来额外挑战。为克服这些障碍,我们提出一种通用的黑盒方法,当配备用于平稳环境的适当学习与测试预言机时,可适用于广泛的问题,如一般和博弈、势博弈与马尔可夫博弈。我们的算法在由总变差 Δ 度量的非平稳程度已知时可实现 后悔,在 Δ 未知时可实现 后悔,其中 为轮数。同时,我们的算法从预言机继承了关于智能体数量的有利依赖。作为一项可能独立有趣的附带贡献,我们展示了如何通过黑盒归约到单智能体学习来测试各类均衡,包括纳什均衡、相关均衡与粗相关均衡。
引用
@article{arxiv.2306.07465,
title = {A Black-box Approach for Non-stationary Multi-agent Reinforcement Learning},
author = {Haozhe Jiang and Qiwen Cui and Zhihan Xiong and Maryam Fazel and Simon S. Du},
journal= {arXiv preprint arXiv:2306.07465},
year = {2024}
}
备注
26 Pages, 2 figures