中文

部分可观测马尔可夫博弈的样本高效强化学习

机器学习 2022-10-18 v2 人工智能 计算机科学与博弈论 机器学习

摘要

本文考虑部分可观测性下的多智能体强化学习(MARL)挑战性任务,其中每个智能体仅能观察到自身的个体观测与动作,这些信息揭示了关于系统底层状态的不完整信息。本文在多人一般和的部分可观测马尔可夫博弈(POMG)这一通用模型下研究这些任务,该模型显著大于不完美信息扩展式博弈(IIEFG)的标准模型。我们识别出POMG的一个丰富子类——弱揭示POMG——其中样本高效学习是易处理的。在自博弈设定下,我们证明,将乐观主义与最大似然估计(MLE)相结合的简单算法,足以在智能体数量较少时以多项式样本数找到弱揭示POMG的近似纳什均衡、相关均衡以及粗相关均衡。在与对抗性对手博弈的设定下,我们展示,我们乐观MLE算法的一个变体能够在与最优最大最小策略比较时实现次线性后悔。据我们所知,本工作提供了学习POMG的首批样本高效结果。

关键词

引用

@article{arxiv.2206.01315,
  title  = {Sample-Efficient Reinforcement Learning of Partially Observable Markov Games},
  author = {Qinghua Liu and Csaba Szepesvári and Chi Jin},
  journal= {arXiv preprint arXiv:2206.01315},
  year   = {2022}
}