中文

Steel-LLM:从零到开源——构建中文中心语言模型的实践之路

计算与语言 2025-02-14 v2 人工智能

摘要

Steel-LLM 是一个从零构建的中文中心语言模型,旨��在有限的计算资源下创建高质量、开源的模型。该项目于2024年3月启动,旨在大规模数据集上训练10亿参数模型,强调透明度并分享实用见解,以帮助社区中的其他人。训练过程主要聚焦中文数据,少量英文数据included,旨弥补现有开源LLM的不足,提供更详细、更实用的模型构建之路。Steel-LLM 在CEVAL 和 CMMLU 等基准测试中表现出竞争力,超越了来自大型机构的早期模型。本文提供了项目关键贡献的综合概述,包括数据收集、模型设计、训练方法以及途中所遇到的挑战,为寻求开发自己LLM的研究人员和实践者提供了宝贵资源。模型检查点和训练脚本可在 https://github.com/zhanshijinwat/Steel-LLM 获取。

关键词

引用

@article{arxiv.2502.06635,
  title  = {Steel-LLM:From Scratch to Open Source -- A Personal Journey in Building a Chinese-Centric LLM},
  author = {Qingshui Gu and Shu Li and Tianyu Zheng and Zhaoxiang Zhang},
  journal= {arXiv preprint arXiv:2502.06635},
  year   = {2025}
}