Steel-LLM:从零到开源——构建中文中心语言模型的实践之路
计算与语言
2025-02-14 v2 人工智能
摘要
Steel-LLM 是一个从零构建的中文中心语言模型,旨��在有限的计算资源下创建高质量、开源的模型。该项目于2024年3月启动,旨在大规模数据集上训练10亿参数模型,强调透明度并分享实用见解,以帮助社区中的其他人。训练过程主要聚焦中文数据,少量英文数据included,旨弥补现有开源LLM的不足,提供更详细、更实用的模型构建之路。Steel-LLM 在CEVAL 和 CMMLU 等基准测试中表现出竞争力,超越了来自大型机构的早期模型。本文提供了项目关键贡献的综合概述,包括数据收集、模型设计、训练方法以及途中所遇到的挑战,为寻求开发自己LLM的研究人员和实践者提供了宝贵资源。模型检查点和训练脚本可在 https://github.com/zhanshijinwat/Steel-LLM 获取。
引用
@article{arxiv.2502.06635,
title = {Steel-LLM:From Scratch to Open Source -- A Personal Journey in Building a Chinese-Centric LLM},
author = {Qingshui Gu and Shu Li and Tianyu Zheng and Zhaoxiang Zhang},
journal= {arXiv preprint arXiv:2502.06635},
year = {2025}
}