中文

InternEvo:通过混合并行与冗余分片实现高效长序列大语言模型训练

分布式、并行与集群计算 2024-01-23 v3

摘要

具有长序列的大语言模型(LLMs)开始赋能越来越多我们日常使用的全新应用。现有的长序列LLM训练方法既不高效,也不兼容FlashAttention等常用训练算法。我们设计了InternEvo来解决这些问题。InternEvo将所有分片维度解耦到一个新的层次化空间中,并系统分析了LLM训练的内存和通信成本。然后,它生成一种有效的混合并行策略。我们设计了一种新的选择性重叠机制,以减轻混合并行引入的通信开销。我们还实现了内存管理技术以减少GPU内存碎片。评估结果表明,InternEvo生成的并行化策略在模型FLOPs利用率上达到或优于现有方法。

关键词

引用

@article{arxiv.2401.09149,
  title  = {InternEvo: Efficient Long-sequence Large Language Model Training via Hybrid Parallelism and Redundant Sharding},
  author = {Qiaoling Chen and Diandian Gu and Guoteng Wang and Xun Chen and YingTong Xiong and Ting Huang and Qinghao Hu and Xin Jin and Yonggang Wen and Tianwei Zhang and Peng Sun},
  journal= {arXiv preprint arXiv:2401.09149},
  year   = {2024}
}