二人零和同时行动博弈中的强化学习
机器学习
2021-10-12 v1 计算机科学与博弈论
摘要
二人零和同时行动博弈在电子游戏、金融市场、战争、商业竞争以及许多其他场景中是常见的。我们首先介绍二人零和同时行动博弈中强化学习的基本概念,并讨论此类博弈带来的独特挑战。然后我们引入两个新颖的智能体,试图通过使用联合行动深度 Q 网络(Deep Q-Networks, DQN)来应对这些挑战。第一个智能体称为最佳响应智能体(Best Response AgenT, BRAT),它使用模仿学习对其对手的策略建立显式模型,然后利用该模型寻找最佳响应以利用对手的策略。第二个智能体 Meta-Nash DQN 对其对手的策略建立隐式模型,以产生一个作为 Q 值计算一部分的上下文变量。通过对 Q 值使用显式极小极大来寻找接近纳什均衡的动作。我们通过实验发现,两个智能体在简单矩阵博弈的自博弈设置中均收敛到纳什均衡,同时在具有更大状态和动作空间的博弈中也表现良好。这些新颖的算法与原始 RL 算法以及近期的 SOTA 多智能体和双智能体算法进行了评估。本工作结合了传统强化学习、博弈论和元学习的思想。
引用
@article{arxiv.2110.04835,
title = {Reinforcement Learning In Two Player Zero Sum Simultaneous Action Games},
author = {Patrick Phillips},
journal= {arXiv preprint arXiv:2110.04835},
year = {2021}
}