以人类速度:带动作延迟的深度强化学习
人工智能
2018-10-18 v1 机器学习
摘要
近年来,游戏人工智能的能力出现了爆发式增长。从视频游戏到运动控制再到棋类游戏,许多类型的任务现在都可以通过相当通用的算法来解决,这些算法基于深度学习和强化学习,能够从经验中学习游戏,且只需极少的先验知识。然而,这些机器往往并非仅凭智能取胜——它们拥有远超人类的速度和精度,从而能够做出人类绝不可能做出的动作。为了拉平竞争环境,我们将机器的反应时间限制在人类水平,并发现标准的深度强化学习方法性能迅速下降。我们提出了一种受人类感知启发的动作延迟问题解决方案——赋予智能体一个对环境的神经预测模型,该模型能够“消除”其环境中固有的延迟——并在流行主机格斗游戏《超级马里奥兄弟:终极版》(Super Smash Bros. Melee)中针对职业玩家证明了其有效性。
引用
@article{arxiv.1810.07286,
title = {At Human Speed: Deep Reinforcement Learning with Action Delay},
author = {Vlad Firoiu and Tina Ju and Josh Tenenbaum},
journal= {arXiv preprint arXiv:1810.07286},
year = {2018}
}