中文

基于大规模行为克隆的《反恐精英》死斗模式AI

人工智能 2021-12-10 v2 机器学习 机器学习

摘要

本文描述了一种从像素输入来游玩流行第一人称射击(FPS)电子游戏《反恐精英:全球攻势》(CSGO)的AI智能体。该智能体是一个深度神经网络,在死斗游戏模式下达到了内置中等难度AI的表现水平,同时采用了类人的游戏风格。与许多先前的游戏研究不同,CSGO不提供API,因此算法必须实时训练和运行。这限制了可生成的政策内数据(on-policy data)数量,使得许多强化学习算法无法使用。我们的解决方案使用行为克隆——在从在线服务器上人类游玩中抓取的大规模含噪数据集(400万帧,规模与ImageNet相当)以及较小规模的高质量专家演示数据集上进行训练。这一规模比先前FPS游戏中模仿学习工作的数据量大了一个数量级。

关键词

引用

@article{arxiv.2104.04258,
  title  = {Counter-Strike Deathmatch with Large-Scale Behavioural Cloning},
  author = {Tim Pearce and Jun Zhu},
  journal= {arXiv preprint arXiv:2104.04258},
  year   = {2021}
}

备注

Offline Reinforcement Learning Workshop at Neural Information Processing Systems, 2021