用于可扩展强化学习的 Podracer 架构
机器学习
2021-04-14 v1
摘要
支持最先进的人工智能研究需要在快速原型开发、易用性和快速迭代,与传统上关联于生产系统的规模化实验部署能力之间取得平衡。TensorFlow、PyTorch 和 JAX 等深度学习框架允许用户透明地利用 TPU 和 GPU 等加速器,将现代深度学习系统中训练和推理的计算密集型部分卸载。使用这些框架进行深度学习的流行训练流水线通常聚焦于(无)监督学习。如何以最佳方式大规模训练强化学习(RL)智能体仍是一个活跃的研究领域。在本报告中,我们认为 TPU 特别适合以可扩展、高效且可复现的方式训练 RL 智能体。具体而言,我们描述了两种旨在充分利用 TPU Pod(Google 数据中心中一种特殊配置,具有多个通过极低延迟通信信道相互连接的 TPU 设备)上可用资源的架构。
引用
@article{arxiv.2104.06272,
title = {Podracer architectures for scalable Reinforcement Learning},
author = {Matteo Hessel and Manuel Kroiss and Aidan Clark and Iurii Kemaev and John Quan and Thomas Keck and Fabio Viola and Hado van Hasselt},
journal= {arXiv preprint arXiv:2104.06272},
year = {2021}
}