中文

FLM-101B:一个开放 LLM 及如何以 10 万美元预算训练它

计算与语言 2025-01-15 v3 人工智能

摘要

大语言模型(LLMs)被视为通向基础机器智能的重要路径,在自然语言处理及多模态任务等方面取得显著成功。然而,繁重预训练计算所产生的碳足迹与财务成本是不可忽视的问题。受神经发生过程(即神经结构生长)启发的渐进式训练方法,已展现出加速 LLM 预训练的潜力。然而,针对超 100B 参数 LLM 的渐进式训练算法、实现与实践仍待探索。本文中,我们展示了我们的模型 FLM-101B:在 10 万美元预算下采用我们的增长策略训练,仅用基线浮点运算量的 10% 便达到其性能的 80%。我们相信对渐进式训练的进一步研究将通过降低成本、推动绿色 AI 惠及社区。FLM-101B 的 checkpoint 发布于 https://huggingface.co/CofeAI/FLM-101B。

关键词

引用

@article{arxiv.2309.03852,
  title  = {FLM-101B: An Open LLM and How to Train It with $100K Budget},
  author = {Xiang Li and Yiqun Yao and Xin Jiang and Xuezhi Fang and Xuying Meng and Siqi Fan and Peng Han and Jing Li and Li Du and Bowen Qin and Zheng Zhang and Aixin Sun and Yequan Wang},
  journal= {arXiv preprint arXiv:2309.03852},
  year   = {2025}
}