分布式强化学习在CPU-GPU系统上的架构影响
机器学习
2020-12-09 v1 硬件体系结构
摘要
随着深度强化学习方法在游戏、机器人和模拟环境中取得超越人类能力的结果,持续扩展强化学习训练对于其在解决复杂现实问题中的部署至关重要。然而,通过理解CPU-GPU系统的架构影响来提高强化学习训练的性能可扩展性和能效仍然是一个开放问题。在这项工作中,我们通过从整体系统级分析角度而非仅从GPU微架构角度来研究问题,从而调查并改进了CPU-GPU系统上分布式强化学习训练的性能和能效。我们在最先进的分布式强化学习训练框架上量化了整体硬件利用率,并通过经验确定了由GPU微架构、算法和系统级设计选择引起的瓶颈。我们表明,GPU微架构本身对于最先进的强化学习框架是平衡的,但进一步的研究揭示,运行环境交互的actor数量以及它们可用的硬件资源是主要的性能和能效限制因素。为此,我们引入了一个新的系统设计指标——CPU/GPU比率,并展示了在为强化学习训练设计可扩展且高效的CPU-GPU系统时如何找到CPU和GPU资源之间的最佳平衡。
引用
@article{arxiv.2012.04210,
title = {The Architectural Implications of Distributed Reinforcement Learning on CPU-GPU Systems},
author = {Ahmet Inci and Evgeny Bolotin and Yaosheng Fu and Gal Dalal and Shie Mannor and David Nellans and Diana Marculescu},
journal= {arXiv preprint arXiv:2012.04210},
year = {2020}
}
备注
To appear in the proceedings of the 6th Workshop on Energy Efficient Machine Learning and Cognitive Computing (EMC2) 2020