中文

平均奖励目标下随机博弈中的去中心化无模型强化学习

机器学习 2023-01-16 v1 人工智能 计算机科学与博弈论 多智能体系统

摘要

我们提出了首个在具有无限时域平均奖励目标的两人零和表格型随机博弈中实现低遗憾性能的去中心化学习无模型算法。在去中心化学习中,学习智能体仅控制一名玩家,并试图针对任意对手实现低遗憾性能。这与智能体通过控制双方玩家来尝试逼近纳什均衡的集中式学习形成对比。在我们的无限时域无折扣设定中,需要额外的结构假设来保证学习过程的良好行为:这里我们假设对于对手的每种策略,智能体都有办法从任意状态转移到任意其他状态。该假设类似于MDP设定中的“连通”假设。我们证明了我们的去中心化乐观纳什Q学习(DONQ-learning)算法既能实现 T3/4T^{3/4} 阶的次线性高概率遗憾,也能实现 T2/3T^{2/3} 阶的次线性期望遗憾。此外,与相同设定下的先前工作(Wei et al. 2017)和(Jafarnia-Jahromi et al. 2021)相比,我们的算法具有较低的计算复杂度和较低的内存空间需求。

关键词

引用

@article{arxiv.2301.05630,
  title  = {Decentralized model-free reinforcement learning in stochastic games with average-reward objective},
  author = {Romain Cravic and Nicolas Gast and Bruno Gaujal},
  journal= {arXiv preprint arXiv:2301.05630},
  year   = {2023}
}

备注

Accepted to the 22th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2023). This version is the full version with proofs in appendix