中文

无奖金激励:基于模型的在线多智能体强化学习

机器学习 2025-02-17 v1 人工智能 计算机科学与博弈论 最优化与控制

摘要

多智能体强化学习 (MARL) 是许多涉及多个代理人在共享未知环境中相互作用的应用的核心。Markov 游戏是研究 MARL 的重要框架,旨在以样本高效的方式寻找各种均衡概念,如纳什均衡 (NE) 和粗糙相关均衡 (CCE)。然而,现有的样本高效方法要么需要针对函数近似的定制不确定性估计,要么需要仔细的玩家间协调。在本文中,我们提出了一种新颖的基于模型的算法,称为 VMG,通过对模型参数的经验估计进行偏置,以提高所有玩家在固定其他玩家策略时的集合最佳响应值,从而激励策略偏离当前均衡以进行更充分的探索。VMG 对不同的函数近似形式不敏感,允许所有玩家的同时且独立的策略更新。理论上,我们也证明了在线性函数近似下,VMG 在在线环境中实现了寻找两个玩家零和 Markov 游戏 NE 以及多玩家一般和 Markov 游戏 CCE 的近最优 regret,这几乎匹配了具有复杂不确定性量化的方法的对应结果。

关键词

引用

@article{arxiv.2502.09780,
  title  = {Incentivize without Bonus: Provably Efficient Model-based Online Multi-agent RL for Markov Games},
  author = {Tong Yang and Bo Dai and Lin Xiao and Yuejie Chi},
  journal= {arXiv preprint arXiv:2502.09780},
  year   = {2025}
}