基于策略式奖励的可证明高效离线多智能体强化学习
机器学习
2022-10-17 v2 人工智能
计算机科学与博弈论
多智能体系统
摘要
本文研究离线多智能体强化学习。我们提出策略式集中原理,直接为联合策略构建置信区间,不同于为联合动作空间中每一点构建置信区间的点式集中原理。对于两人零和马尔可夫博弈,利用策略式奖励的凸性,我们提出一种计算高效的算法,其样本复杂度对动作数量的依赖优于先前基于点式奖励的方法。此外,对于离线多智能体一般和马尔可夫博弈,基于策略式奖励与一种新颖的代理函数,我们给出首个样本复杂度仅随 缩放的算法,其中 为第 个玩家的动作规模, 为玩家数。形成鲜明对比的是,基于点式奖励的方法因多智能体维度灾难,其样本复杂度随联合动作空间大小 缩放。最后,我们所有算法均可自然地将预先指定的策略类 作为输入,并输出接近 中最佳策略的策略。在此设定下,样本复杂度仅随 而非 缩放。
引用
@article{arxiv.2206.00159,
title = {Provably Efficient Offline Multi-agent Reinforcement Learning via Strategy-wise Bonus},
author = {Qiwen Cui and Simon S. Du},
journal= {arXiv preprint arXiv:2206.00159},
year = {2022}
}
备注
34 pages; accepted by NeurIPS 2022