中文

52B 至 1T:通过 Tele-FLM 系列所获经验

计算与语言 2024-07-04 v1 人工智能

摘要

大型语言模型(LLMs)代表了向通用人工智能迈出的重要一步。随着规模定律凸显模型规模潜力,学术界加强了对超过 500 亿参数的 LLMs 的研究。本技术报告建立在先前与 Tele-FLM(亦称 FLM-2)——一个公开的 520 亿参数模型——的工作基础上。我们首先讨论了在 Tele-FLM-52B 上进行的监督微调(SFT),支持“少即是多”的数据构建方法;其次,我们展示了从 520 亿参数逐步扩展至 1020 亿参数,再至 1 万亿参数的最佳实践。我们将开源 1T 模型检查点,即 Tele-FLM-1T,以推动后续训练与研究。

关键词

引用

@article{arxiv.2407.02783,
  title  = {52B to 1T: Lessons Learned via Tele-FLM Series},
  author = {Xiang Li and Yiqun Yao and Xin Jiang and Xuezhi Fang and Chao Wang and Xinzhang Liu and Zihan Wang and Yu Zhao and Xin Wang and Yuyao Huang and Shuangyong Song and Yongxiang Li and Zheng Zhang and Bo Zhao and Aixin Sun and Yequan Wang and Zhongjiang He and Zhongyuan Wang and Xuelong Li and Tiejun Huang},
  journal= {arXiv preprint arXiv:2407.02783},
  year   = {2024}
}

备注

For the Tele-FLM-52B tech report, see also 2404.16645