竞争多智能体强化学习中的策略高效探索
机器学习
2021-08-02 v1 人工智能
多智能体系统
摘要
高样本复杂度仍是强化学习(RL)应用的障碍,尤其在多智能体系统中。大量工作表明,基于不确定性下乐观原则的机制可显著提升单智能体任务中 RL 的样本效率。本文旨在理解乐观探索在非合作多智能体设定中的作用。我们将展示,在零和博弈中,乐观探索会导致学习器浪费时间采样状态空间中与策略性博弈无关的部分,因为这些部分只能通过两名玩家的合作到达。为解决此问题,我们引入马尔可夫博弈中策略高效探索的形式化概念,并据此为有限马尔可夫博弈开发两种策略高效学习算法。我们证明这些方法可比其乐观对应方法显著更具样本效率。
引用
@article{arxiv.2107.14698,
title = {Strategically Efficient Exploration in Competitive Multi-agent Reinforcement Learning},
author = {Robert Loftin and Aadirupa Saha and Sam Devlin and Katja Hofmann},
journal= {arXiv preprint arXiv:2107.14698},
year = {2021}
}
备注
To Appear in Uncertainty in Artificial Intelligence (UAI) 2021. 10 figures, 14 pages