中文

YuLan-Mini:一个开放数据高效语言模型

计算与语言 2024-12-25 v2

摘要

大型语言模型(LLM)的有效预训练由于巨大的资源需求和复杂的技术过程而面临挑战。本文提供了关于YuLan-Mini的详细技术报告,该模型拥有2.42B参数,在相似参数规模的模型中实现了顶级性能。我们的预训练方法通过三项关键技术贡献来增强训练效率:精细的数据管道组合数据清洗与数据调度策略,稳健的优化方法以缓解训练不稳定,以及有效的退火方法结合针对性数据选择和长上下文训练。值得注意的是,在1.08T token的训练中,YuLan-Mini实现了与需要显著更多数据的行业领先模型相当的性能。为便于复现,我们发布了每个训练阶段数据组成的完整细节。项目细节可访问链接:https://github.com/RUC-GSAI/YuLan-Mini

关键词

引用

@article{arxiv.2412.17743,
  title  = {YuLan-Mini: An Open Data-efficient Language Model},
  author = {Yiwen Hu and Huatong Song and Jia Deng and Jiapeng Wang and Jie Chen and Kun Zhou and Yutao Zhu and Jinhao Jiang and Zican Dong and Wayne Xin Zhao and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2412.17743},
  year   = {2024}
}