协同训练 Transformer
机器学习
2022-07-08 v1 分布式、并行与集群计算
摘要
训练最先进模型所需的基础设施正变得过于昂贵,这使得只有大型企业和机构才负担得起此类模型的训练。近期的研究提出了几种协同训练此类模型的方法,即通过汇聚许多独立方的硬件并通过互联网训练共享模型。在本演示中,我们协同训练了一个类似于 OpenAI DALL-E 的文本到图像 transformer。我们邀请观众加入正在进行的训练过程,向他们展示如何使用可用硬件贡献算力的说明。我们解释了如何应对此类训练过程相关的工程挑战(慢速通信、有限内存、设备间性能不均以及安全问题),并讨论了观众如何自行搭建协同训练过程。最后,我们展示了所得模型在多个提示下生成了质量合理的图像。
引用
@article{arxiv.2207.03481,
title = {Training Transformers Together},
author = {Alexander Borzunov and Max Ryabinin and Tim Dettmers and Quentin Lhoest and Lucile Saulnier and Michael Diskin and Yacine Jernite and Thomas Wolf},
journal= {arXiv preprint arXiv:2207.03481},
year = {2022}
}
备注
Accepted to NeurIPS 2021 Demonstration Track. 10 pages, 2 figures. Link: https://training-transformers-together.github.io