基于群体深度强化学习在多人第一人称游戏中达到人类水平表现
机器学习
2019-06-19 v1 人工智能
机器学习
摘要
近年来,通过强化学习(RL)在人工智能领域取得的进展,在日益复杂的单智能体环境和双人回合制游戏中展现了巨大成功。然而,真实世界包含多个智能体,每个智能体独立学习与行动,以与其他智能体合作和竞争,反映此种复杂程度的环境仍是一项开放挑战。在这项工作中,我们首次证明了一个智能体可以在流行的3D多人第一人称视频游戏Quake III Arena Capture the Flag中,仅使用像素和游戏得分作为输入达到人类水平。这些结果通过一种新颖的两层优化过程实现,其中一群独立的RL智能体在随机生成的环境中,通过数千场并行比赛、以组队和相互对抗的方式进行同步训练。群体中的每个智能体学习自身的内部奖励信号以补充来自获胜的稀疏延迟奖励,并使用一种新颖的时间分层表征来选择动作,使智能体能够在多个时间尺度上推理。在游戏过程中,这些智能体展现出类似人类的行为,如基于丰富的学习表征进行导航、跟随和防御,该表征被证明编码了高层游戏知识。在广泛的锦标赛式评估中,训练后的智能体作为队友和对手都超过了强人类玩家的胜率,并被证明远强于现有的state-of-the-art智能体。这些结果展示了人工智能体能力的显著飞跃,使我们更接近于人类水平智能的目标。
引用
@article{arxiv.1807.01281,
title = {Human-level performance in first-person multiplayer games with population-based deep reinforcement learning},
author = {Max Jaderberg and Wojciech M. Czarnecki and Iain Dunning and Luke Marris and Guy Lever and Antonio Garcia Castaneda and Charles Beattie and Neil C. Rabinowitz and Ari S. Morcos and Avraham Ruderman and Nicolas Sonnerat and Tim Green and Louise Deason and Joel Z. Leibo and David Silver and Demis Hassabis and Koray Kavukcuoglu and Thore Graepel},
journal= {arXiv preprint arXiv:1807.01281},
year = {2019}
}