Sample Factory:基于异步强化学习以 100000 FPS 从像素进行自我中心 3D 控制的系统
机器学习
2020-06-24 v2 人工智能
机器学习
摘要
扩大强化学习实验的规模使研究者能够在为视频游戏训练复杂智能体以及机器人学的仿真到现实迁移方面取得前所未有的成果。通常此类实验依赖大型分布式系统并需要昂贵的硬件配置,限制了更广泛地参与这一令人振奋的研究领域。在本工作中,我们旨在通过优化强化学习算法的效率与资源利用来解决此问题,而非依赖分布式计算。我们提出“Sample Factory”,一种为单机环境优化的高吞吐训练系统。我们的架构将高效的异步基于 GPU 的采样器与离屏策略修正技术相结合,使我们能够在非平凡的 3D 控制问题上实现高于 环境帧/秒的吞吐,且不牺牲样本效率。我们将 Sample Factory 扩展以支持自对弈与基于种群的训练,并应用这些技术为多人第一人称射击游戏训练能力极强的智能体。源代码见 https://github.com/alex-petrenko/sample-factory
引用
@article{arxiv.2006.11751,
title = {Sample Factory: Egocentric 3D Control from Pixels at 100000 FPS with Asynchronous Reinforcement Learning},
author = {Aleksei Petrenko and Zhehui Huang and Tushar Kumar and Gaurav Sukhatme and Vladlen Koltun},
journal= {arXiv preprint arXiv:2006.11751},
year = {2020}
}
备注
Paper published in ICML2020. Visualizations of trained policies can be found at https://sites.google.com/view/sample-factory