中文

Skywork:一个更开放的双语基础模型

计算与语言 2023-10-31 v1 人工智能

摘要

在本技术报告中,我们提出 Skywork-13B,一个在超过 3.2 万亿 token 的英汉双语文本语料上训练的大语言模型(LLM)系列。该双语基础模型是迄今同等规模中训练最充分且公开发布的 LLM。我们引入了一种使用分段语料的两阶段训练方法,分别面向通用目的训练与领域特定增强训练。我们表明,我们的模型不仅在流行基准上表现出色,还在多样领域的汉语言建模上取得了\emph{最先进}(state of the art)性能。此外,我们提出了一种新颖的泄漏检测方法,证明测试数据污染是一个亟待 LLM 界进一步研究的紧迫问题。为激励未来研究,我们发布 Skywork-13B 及训练过程中间阶段获得的检查点。我们还发布了部分 SkyPile 语料,一个超过 1500 亿 token 的网页文本集合,是迄今最大的高质量开放中文预训练语料。我们希望 Skywork-13B 与我们的开放语料能作为宝贵的开源资源,使高质量 LLM 的获取民主化。

关键词

引用

@article{arxiv.2310.19341,
  title  = {Skywork: A More Open Bilingual Foundation Model},
  author = {Tianwen Wei and Liang Zhao and Lichang Zhang and Bo Zhu and Lijie Wang and Haihua Yang and Biye Li and Cheng Cheng and Weiwei Lü and Rui Hu and Chenxia Li and Liu Yang and Xilin Luo and Xuejie Wu and Lunan Liu and Wenjun Cheng and Peng Cheng and Jianhao Zhang and Xiaoyu Zhang and Lei Lin and Xiaokun Wang and Yutuan Ma and Chuanhai Dong and Yanqi Sun and Yifu Chen and Yongyi Peng and Xiaojuan Liang and Shuicheng Yan and Han Fang and Yahui Zhou},
  journal= {arXiv preprint arXiv:2310.19341},
  year   = {2023}
}