无奖金激励:基于模型的在线多智能体强化学习
机器学习
2025-02-17 v1 人工智能
计算机科学与博弈论
最优化与控制
摘要
多智能体强化学习 (MARL) 是许多涉及多个代理人在共享未知环境中相互作用的应用的核心。Markov 游戏是研究 MARL 的重要框架,旨在以样本高效的方式寻找各种均衡概念,如纳什均衡 (NE) 和粗糙相关均衡 (CCE)。然而,现有的样本高效方法要么需要针对函数近似的定制不确定性估计,要么需要仔细的玩家间协调。在本文中,我们提出了一种新颖的基于模型的算法,称为 VMG,通过对模型参数的经验估计进行偏置,以提高所有玩家在固定其他玩家策略时的集合最佳响应值,从而激励策略偏离当前均衡以进行更充分的探索。VMG 对不同的函数近似形式不敏感,允许所有玩家的同时且独立的策略更新。理论上,我们也证明了在线性函数近似下,VMG 在在线环境中实现了寻找两个玩家零和 Markov 游戏 NE 以及多玩家一般和 Markov 游戏 CCE 的近最优 regret,这几乎匹配了具有复杂不确定性量化的方法的对应结果。
引用
@article{arxiv.2502.09780,
title = {Incentivize without Bonus: Provably Efficient Model-based Online Multi-agent RL for Markov Games},
author = {Tong Yang and Bo Dai and Lin Xiao and Yuejie Chi},
journal= {arXiv preprint arXiv:2502.09780},
year = {2025}
}