PanGu-$\pi$:通过非线性补偿增强语言模型架构
计算与语言
2024-01-01 v1 机器学习
摘要
最近大型语言模型(LLM)的趋势是增加模型规模(即参数数量)和数据集规模,以获得更好的生成能力,这已被许多工作(如著名的GPT和Llama)充分证明。然而,大型模型通常涉及巨大的计算成本,实际应用无法承受如此高的代价。然而,构建强模型架构的方法很少被讨论。我们首先分析了最先进的语言模型架构,并观察到特征坍塌问题。基于理论分析,我们提出非线性对于语言模型也非常重要,这通常在视觉任务的卷积神经网络中研究。然后引入了序列信息激活函数,其计算量极小可忽略,并进一步使用增强的捷径来增强模型非线性。通过精心设计的消融实验,我们证明了所提方法在增强模型非线性方面显著有效;因此,我们提出了一种新的高效模型架构用于构建现代语言模型,即PanGu-。然后使用相同的数据集和训练策略进行实验,将PanGu-与最先进的LLM进行比较。结果表明,PanGu--7B在约10%推理加速的情况下可以达到与基准相当的性能,而PanGu--1B在准确性和效率方面达到了最先进的性能。此外,我们已在金融和法律等高价值领域部署了PanGu--7B,开发了一个名为YunShan的LLM用于实际应用。结果表明,YunShan在基准测试中可以超越其他类似规模的模型。
引用
@article{arxiv.2312.17276,
title = {PanGu-$\pi$: Enhancing Language Model Architectures via Nonlinearity Compensation},
author = {Yunhe Wang and Hanting Chen and Yehui Tang and Tianyu Guo and Kai Han and Ying Nie and Xutao Wang and Hailin Hu and Zheyuan Bai and Yun Wang and Fangcheng Liu and Zhicheng Liu and Jianyuan Guo and Sinan Zeng and Yinchen Zhang and Qinghua Xu and Qun Liu and Jun Yao and Chao Xu and Dacheng Tao},
journal= {arXiv preprint arXiv:2312.17276},
year = {2024}
}