中文

竞争型强化学习中可证明的自博弈算法

机器学习 2020-07-10 v3 人工智能 机器学习

摘要

自博弈(self-play)是指算法通过与自身对弈而不需要任何直接监督来进行学习,已成为现代强化学习(RL)在实践中达到超人类表现的新型武器。然而,现有强化学习理论大多仅适用于智能体对固定环境博弈的设定;自博弈算法是否可证明有效仍基本开放,尤其在必须权衡探索与利用时。我们在竞争型强化学习中的马尔可夫博弈(Markov games,马尔可夫决策过程在双人情形下的推广)设定下研究自博弈。我们引入一种自博弈算法——带上下置信界的值迭代(VI-ULCB)——并证明其在博弈 TT 步后达到遗憾 O~(T)\tilde{\mathcal{O}}(\sqrt{T}),其中遗憾由智能体对抗完全对抗性对手的表现衡量,该对手可在任意步利用智能体的策略。我们还引入一种先探索后利用风格的算法,其遗憾略差为 O~(T2/3)\tilde{\mathcal{O}}(T^{2/3}),但保证即使在最坏情况下也能在多项式时间内运行。据我们所知,我们的工作提出了首个可证明样本高效的竞争型强化学习自博弈算法。

关键词

引用

@article{arxiv.2002.04017,
  title  = {Provable Self-Play Algorithms for Competitive Reinforcement Learning},
  author = {Yu Bai and Chi Jin},
  journal= {arXiv preprint arXiv:2002.04017},
  year   = {2020}
}

备注

Appearing at ICML 2020. Fixed typos from v1