中文

BaichuanSEED:通过引入竞争性大语言模型基线来共享 extensivE 数据收集与去重潜力

计算与语言 2024-08-28 v1 人工智能

摘要

大型语言模型 (LLM) 的通用能力高度依赖其广泛预训练数据集的组成与选择,这些数据集被视为商业机密。为缓解此问题,本文开源通用适用的数据处理管道细节,并通过引入竞争性 LLM 基线验证其有效性与潜力。具体而言,数据处理管道包括从广泛收集以扩大规模以及重新加权以提高质量。随后,我们使用由管道处理的 3T 标记预训练一个 7B 参数的模型 BaichuanSEED,未进行任何刻意的下游任务相关优化,随后进行一次易于且有效的监督式微调。BaichuanSEED 在训练期间表现出一致性和可预测性,并在多个商业先进大型语言模型(如 Qwen1.5 和 Llama3)的全面基准测试中实现了相当水平的性能。我们还进行了若干启发式实验,以讨论进一步优化下游任务潜力,如数学和编码。

关键词

引用

@article{arxiv.2408.15079,
  title  = {BaichuanSEED: Sharing the Potential of ExtensivE Data Collection and Deduplication by Introducing a Competitive Large Language Model Baseline},
  author = {Guosheng Dong and Da Pan and Yiding Sun and Shusen Zhang and Zheng Liang and Xin Wu and Yanjun Shen and Fan Yang and Haoze Sun and Tianpeng Li and Mingan Lin and Jianhua Xu and Yufan Zhang and Xiaonan Nie and Lei Su and Bingning Wang and Wentao Zhang and Jiaxin Mao and Zenan Zhou and Weipeng Chen},
  journal= {arXiv preprint arXiv:2408.15079},
  year   = {2024}
}

备注

19 pages, 6 figures