TF-Replicator:面向研究人员的分布式机器学习框架
机器学习
2019-02-04 v1 人工智能
分布式、并行与集群计算
机器学习
摘要
我们描述了 TF-Replicator,一个为 DeepMind 研究人员设计、作为 TensorFlow 上层抽象实现的分布式机器学习框架。TF-Replicator 简化了数据并行和模型并行研究代码的编写。相同的模型可使用同步或异步训练机制,轻松部署到不同的集群架构(即包含 CPU、GPU 或 TPU 加速器的一台或多台机器)。为展示 TF-Replicator 的通用性和可扩展性,我们实现并基准测试了三种差异很大的模型:(1) 用于 ImageNet 分类的 ResNet-50,(2) 用于类条件 ImageNet 图像生成的 SN-GAN,以及 (3) 用于连续控制的 D4PG 强化学习智能体。我们的结果显示出强劲的可扩展性性能,且无需用户具备任何分布式系统专业知识。TF-Replicator 编程模型将作为 TensorFlow 2.0 的一部分开源(见 https://github.com/tensorflow/community/pull/25)。
引用
@article{arxiv.1902.00465,
title = {TF-Replicator: Distributed Machine Learning for Researchers},
author = {Peter Buchlovsky and David Budden and Dominik Grewe and Chris Jones and John Aslanides and Frederic Besse and Andy Brock and Aidan Clark and Sergio Gómez Colmenarejo and Aedan Pope and Fabio Viola and Dan Belov},
journal= {arXiv preprint arXiv:1902.00465},
year = {2019}
}