LLM360 K2:从零开始构建 650 亿参数 360-开源大语言模型
机器学习
2025-01-20 v3
摘要
我们详细阐述了 LLM360 K2-65B 模型的训练,将我们 360 度开源方法的规模提升至最大且最强大的模型 under project LLM360。尽管开源 LLM 持续进步,但关于 "最大规模 LLM 如何训练?" 的答案仍不清晰。对于如此高容量模型的实现细节往往受商业保密,出于高昂成本的考虑。这一缺乏透明度阻碍了 LLM 研究者利用先前经验,例如 "如何解决 loss spike?" 等宝贵见解。LLM360 K2 项目旨在弥补这一差距,通过提供在最大规模 LLM 训练期间积累的资源的完整透明度和可访问性。本报告概述了 K2 项目的关键要素,包括我们的首个模型 K2 DIAMOND,这一 650 亿参数 LLM 超越 LLaMA-65B,与 LLaMA2-70B 相媲美,却使用的 FLOPs 和 token 更少。我们详细阐述了实现步骤,并对 K2 DIAMOND 在整个训练过程中能力的纵向分析。我们还概述了 ongoing 项目如 TXT360,为该系列的未来模型铺平道路。通过提供此前不可获得的资源,K2 项目也呼应了 360 度开源原则的 transparency、reproducibility 和 accessibility,我们认为这些在资源密集型 AI 研究时代至关重要。
引用
@article{arxiv.2501.07124,
title = {LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch},
author = {Zhengzhong Liu and Bowen Tan and Hongyi Wang and Willie Neiswanger and Tianhua Tao and Haonan Li and Fajri Koto and Yuqi Wang and Suqi Sun and Omkar Pangarkar and Richard Fan and Yi Gu and Victor Miller and Liqun Ma and Liping Tang and Nikhil Ranjan and Yonghao Zhuang and Guowei He and Renxi Wang and Mingkai Deng and Robin Algayres and Yuanzhi Li and Zhiqiang Shen and Preslav Nakov and Eric Xing},
journal= {arXiv preprint arXiv:2501.07124},
year = {2025}
}