一种用于双人 Atari 游戏中寻找不可利用策略的深度强化学习方法
机器学习
2023-03-08 v3 人工智能
计算机科学与博弈论
摘要
本文提出新的端到端深度强化学习算法,用于学习双人零和马尔可夫博弈。与以往训练智能体击败固定对手集合的工作不同,我们的目标是寻找即便面对对抗性对手也不会被利用的纳什均衡策略。我们提出(a)Nash-DQN 算法,将单一 DQN 的深度学习技术融入经典的 Nash Q-learning 算法以求解表格型马尔可夫博弈;(b)Nash-DQN-Exploiter 算法,额外采用一个利用者来引导主智能体的探索。我们在表格示例以及多种双人 Atari 游戏上进行了实验评估。实证结果表明:(i)包括 Neural Fictitious Self Play 与 Policy Space Response Oracle 在内的许多现有方法所得到的策略易被对抗性对手利用;(ii)我们算法输出的策略对利用具有鲁棒性,因而优于现有方法。
引用
@article{arxiv.2207.08894,
title = {A Deep Reinforcement Learning Approach for Finding Non-Exploitable Strategies in Two-Player Atari Games},
author = {Zihan Ding and Dijia Su and Qinghua Liu and Chi Jin},
journal= {arXiv preprint arXiv:2207.08894},
year = {2023}
}