中文

YUAN 2.0:一种基于局部滤波注意力的大型语言模型

计算与语言 2023-12-19 v4 人工智能 人机交互

摘要

在本工作中,我们开发并发布了 Yuan 2.0,一系列参数规模从 21 亿到 1026 亿的大型语言模型。我们引入了基于局部滤波的注意力(LFA),将自然语言的局部依赖先验知识融入注意力机制中。我们提出了一套数据过滤与生成系统,以构建高质量的预训练与微调数据集。我们提出了一种结合非均匀流水线并行、数据并行与优化器并行的分布式训练方法,大幅降低了节点内通信的带宽需求,并在大规模分布式训练中取得了良好性能。与现有模型相比,Yuan 2.0 模型在代码生成、数学解题与对话方面展现出令人印象深刻的能力。YUAN 2.0 的最新版本,包括模型权重与源代码,可在 Github 上获取。

关键词

引用

@article{arxiv.2311.15786,
  title  = {YUAN 2.0: A Large Language Model with Localized Filtering-based Attention},
  author = {Shaohua Wu and Xudong Zhao and Shenling Wang and Jiangang Luo and Lingjun Li and Xi Chen and Bing Zhao and Wei Wang and Tong Yu and Rongguo Zhang and Jiahua Zhang and Chao Wang},
  journal= {arXiv preprint arXiv:2311.15786},
  year   = {2023}
}