中文

Frontier上大型语言模型架构的比较研究

分布式、并行与集群计算 2024-02-02 v1

摘要

大型语言模型(LLMs)在人工智能社区及其他领域引起了广泛关注。其中,生成式预训练Transformer(GPT)已成为主导架构,衍生出众多变体。然而,这些变体在不同条件下进行了预训练,包括输入数据、数据预处理和训练方法的变化,导致缺乏受控的比较研究。在此,我们利用世界首台百亿亿次超级计算机Frontier的计算能力,仔细研究了两种著名的开源GPT架构:GPT-NeoX和LLaMA。使用相同的材料科学文本语料库和全面的端到端流水线,我们对它们的训练和下游性能进行了比较分析。我们的努力最终在一个具有挑战性的材料科学基准上取得了最先进的性能。此外,我们研究了计算和能源效率,并提出了一种计算高效的架构设计方法。据我们所知,这些预训练模型是材料科学领域可用的最大模型。我们的发现为在HPC平台上构建LLM提供了实用指导。

关键词

引用

@article{arxiv.2402.00691,
  title  = {Comparative Study of Large Language Model Architectures on Frontier},
  author = {Junqi Yin and Avishek Bose and Guojing Cong and Isaac Lyngaas and Quentin Anthony},
  journal= {arXiv preprint arXiv:2402.00691},
  year   = {2024}
}