中文

Ziya2:以数据为中心的学习是大型语言模型所需的全部

计算与语言 2024-04-05 v2

摘要

近年来提出了各种大型语言模型(LLM),包括闭源和开源模型,不断在多个基准上刷新纪录。然而,LLM的发展仍面临若干问题,例如从头训练模型成本高昂,以及持续预训练导致灾难性遗忘等。尽管许多此类问题已在LLM的研究脉络中得到解决,一个重要但实际的局限是:许多研究过度追求扩大模型规模,而未全面分析与优化预训练数据在学习过程中的使用,以及在成本可控的设置下对这类数据进行恰当的组织与利用。在本工作中,我们提出Ziya2,一个以LLaMA2为基础模型、拥有130亿参数并在7000亿token上进一步预训练的模型,我们聚焦于预训练技术并使用以数据为中心的优化来增强Ziya2在不同阶段的学习过程。我们定义了三种数据属性,并首次建立以数据为中心的缩放定律以阐明不同数据如何影响LLM。实验表明,Ziya2在多个基准上显著优于其他模型,尤其是与代表性开源模型相比取得了令人瞩目的结果。Ziya2(Base)发布于 https://huggingface.co/IDEA-CCNL/Ziya2-13B-Base 和 https://modelscope.cn/models/Fengshenbang/Ziya2-13B-Base/summary。

关键词

引用

@article{arxiv.2311.03301,
  title  = {Ziya2: Data-centric Learning is All LLMs Need},
  author = {Ruyi Gan and Ziwei Wu and Renliang Sun and Junyu Lu and Xiaojun Wu and Dixiang Zhang and Kunhao Pan and Junqing He and Yuanhe Tian and Ping Yang and Qi Yang and Hao Wang and Jiaxing Zhang and Yan Song},
  journal= {arXiv preprint arXiv:2311.03301},
  year   = {2024}
}