中文

TransNormerLLM:基于改进TransNormer的更快更好大语言模型

计算与语言 2024-01-22 v2

摘要

我们提出TransNormerLLM,这是首个基于线性注意力的大语言模型(LLM),在准确率和效率上均优于传统的基于softmax注意力的模型。TransNormerLLM由先前的线性注意力架构TransNormer演进而来,进行了包括位置嵌入、线性注意力加速、门控机制、张量归一化以及推理加速与稳定化在内的先进改进。具体而言,我们使用LRPE配合指数衰减,以避免注意力稀释问题,同时使模型保留词元间的全局交互。此外,我们提出Lightning Attention,一种将线性注意力运行时间加速两倍以上并将内存占用显著减少四倍的尖端技术。为进一步提升TransNormer性能,我们利用门控机制实现平滑训练,并采用新的张量归一化方案加速模型,实现了超过20%20\%的显著提升。进而,我们开发了稳健的推理算法,无论序列长度如何均能保证数值稳定与一致的推理速度,在训练与推理阶段均展现出优越效率。我们还为TransNormerLLM实现了高效的模型并行架构,使其能在大规模集群上无缝部署,并便于扩展至更庞大的模型,即含175B参数的LLM。我们通过一系列消融实验验证模型设计,并在自主收集语料上训练了385M、1B和7B规模的模型。基准结果表明,我们的模型不仅匹敌基于Transformer的最先进LLM的性能,而且显著更快。代码发布于:https://github.com/OpenNLPLab/TransnormerLLM。

关键词

引用

@article{arxiv.2307.14995,
  title  = {TransNormerLLM: A Faster and Better Large Language Model with Improved TransNormer},
  author = {Zhen Qin and Dong Li and Weigao Sun and Weixuan Sun and Xuyang Shen and Xiaodong Han and Yunshen Wei and Baohong Lv and Xiao Luo and Yu Qiao and Yiran Zhong},
  journal= {arXiv preprint arXiv:2307.14995},
  year   = {2024}
}

备注

Technical Report. Yiran Zhong is the corresponding author. Zhen Qin, Dong Li, Weigao Sun, Weixuan Sun, Xuyang Shen contribute equally to this paper. Code is released at: https://github.com/OpenNLPLab/TransnormerLLM