中文

JetMoE:以 0.1M 美元达到 Llama2 性能

计算与语言 2024-04-12 v1 人工智能

摘要

大型语言模型(LLMs)取得了令人瞩目的成果,但其日益增长的资源需求已成为发展强大且可及的超级人类智能的主要障碍。本报告介绍了 JetMoE-8B,这是一种训练成本不到 10 万美元的新 LLM,使用了来自精心混合的开源语料库的 1.25T tokens 和 30,000 个 H100 GPU 小时。尽管成本低廉,JetMoE-8B 展现了出色的性能,JetMoE-8B 优于 Llama2-7B 模型,JetMoE-8B-Chat 超越了 Llama2-13B-Chat 模型。这些结果表明,LLM 训练可以比一般认为的更具成本效益。JetMoE-8B 基于高效的稀疏门控混合专家(SMoE)架构,由注意力专家和前馈专家组成。两层均为稀疏激活,使得 JetMoE-8B 拥有 8B 参数,但对每个输入 token 仅激活 2B,与 Llama2-7B 相比减少了约 70% 的推理计算量。此外,JetMoE-8B 具有高度的开放性和对学术界友好,仅使用公开数据集和训练代码。本报告详细说明了所有的训练参数和数据混合,以促进未来在开放基础模型开发方面的努力。这种透明度旨在鼓励在可及且高效的 LLM 领域的合作与进一步发展。模型权重已在 https://github.com/myshell-ai/JetMoE 公开提供。

关键词

引用

@article{arxiv.2404.07413,
  title  = {JetMoE: Reaching Llama2 Performance with 0.1M Dollars},
  author = {Yikang Shen and Zhen Guo and Tianle Cai and Zengyi Qin},
  journal= {arXiv preprint arXiv:2404.07413},
  year   = {2024}
}