中文

协同训练 Transformer

机器学习 2022-07-08 v1 分布式、并行与集群计算

摘要

训练最先进模型所需的基础设施正变得过于昂贵,这使得只有大型企业和机构才负担得起此类模型的训练。近期的研究提出了几种协同训练此类模型的方法,即通过汇聚许多独立方的硬件并通过互联网训练共享模型。在本演示中,我们协同训练了一个类似于 OpenAI DALL-E 的文本到图像 transformer。我们邀请观众加入正在进行的训练过程,向他们展示如何使用可用硬件贡献算力的说明。我们解释了如何应对此类训练过程相关的工程挑战(慢速通信、有限内存、设备间性能不均以及安全问题),并讨论了观众如何自行搭建协同训练过程。最后,我们展示了所得模型在多个提示下生成了质量合理的图像。

关键词

引用

@article{arxiv.2207.03481,
  title  = {Training Transformers Together},
  author = {Alexander Borzunov and Max Ryabinin and Tim Dettmers and Quentin Lhoest and Lucile Saulnier and Michael Diskin and Yacine Jernite and Thomas Wolf},
  journal= {arXiv preprint arXiv:2207.03481},
  year   = {2022}
}

备注

Accepted to NeurIPS 2021 Demonstration Track. 10 pages, 2 figures. Link: https://training-transformers-together.github.io