面向 N 人博弈的最终自适应强化学习
机器学习
2021-11-30 v1 人工智能
多智能体系统
机器学习
摘要
本文涵盖基于 n 元组的博弈强化学习(RL)算法。我们提出了适用于 TD、SARSA 和 Q-learning 的新算法,可在具有任意数量玩家的各类博弈上无缝运行。这是通过以玩家为中心的视角实现的,其中每位玩家将其奖励回溯传播至之前的回合。我们在所有这些算法中加入了一个称为最终自适应 RL(FARL)的新要素。我们的主要贡献在于,FARL 是以玩家为中心视角下各类博弈取得成功的关键要素。我们报告了在 1、2 和 3 人共七种棋盘博弈(包括 Othello、ConnectFour 和 Hex)上的结果。在大多数情况下发现,FARL 对于学习近乎完美的博弈策略十分重要。所有算法均可在 GitHub 的 GBG 框架中获取。
引用
@article{arxiv.2111.14375,
title = {Final Adaptation Reinforcement Learning for N-Player Games},
author = {Wolfgang Konen and Samineh Bagheri},
journal= {arXiv preprint arXiv:2111.14375},
year = {2021}
}
备注
23 pages