中文

提升无模型算法在零和马尔可夫博弈中的样本效率

机器学习 2024-06-07 v2 人工智能 计算机科学与博弈论 机器学习

摘要

二人零和马尔可夫博弈问题近年来在多智能体强化学习(RL)的理论研究中引起了越来越多的关注。特别地,对于有限时域片段式马尔可夫决策过程(MDP),已有研究表明基于模型的算法可以以 O(H3SAB/ϵ2)O(H^3SAB/\epsilon^2) 的样本复杂度找到 ϵ\epsilon-最优纳什均衡(NE),该复杂度在时域 HH 和状态数 SS 的依赖上是最优的(其中 AABB 分别表示两个玩家的动作数)。然而,现有无模型算法均无法达到此种最优性。本工作中,我们提出一种无模型的分阶段 Q-learning 算法,并证明其达到与最佳基于模型的算法相同的样本复杂度,从而首次证明无模型算法在 HH 依赖上可享有与基于模型的算法相同的最优性。对 HH 依赖的主要改进源于利用了基于参考-优势分解的流行方差缩减技术,该技术此前仅用于单智能体 RL。然而,该技术依赖于值函数的一个关键单调性性质,而由于通过粗相关均衡(CCE)预言机更新策略,该性质在马尔可夫博弈中不成立。因此,为将此类技术推广至马尔可夫博弈,我们的算法设计了一个关键新颖之处:将参考值函数更新为一对乐观与悲观值函数,其历史值差最小,从而实现样本效率上所需的改进。

关键词

引用

@article{arxiv.2308.08858,
  title  = {Improving Sample Efficiency of Model-Free Algorithms for Zero-Sum Markov Games},
  author = {Songtao Feng and Ming Yin and Yu-Xiang Wang and Jing Yang and Yingbin Liang},
  journal= {arXiv preprint arXiv:2308.08858},
  year   = {2024}
}