PanGu-$\pi$ Pro:重新思考小型语言模型的优化与架构
计算与语言
2025-04-04 v4 人工智能
机器学习
摘要
大型语言模型(LLM)的能力已通过大量数据和计算资源得到证明。然而,语言模型在移动设备上的应用面临着计算和内存成本的巨大挑战,即迫切需要高性能的小型语言模型。由于训练过程高度复杂,许多优化语言模型的细节很少被仔细研究。在本研究中,基于一个1B参数的小型语言模型,我们精心设计了一系列实证研究来分析每个组件的影响。主要讨论了三个视角:神经架构、参数初始化和优化策略。经验证明,几种设计公式对小型语言模型特别有效,包括分词器压缩、架构调整、参数继承和多轮训练。然后,我们按照这些公式在1.6T多语言语料库上训练了PanGu--1B Pro和PanGu--1.5B Pro。实验结果表明,改进的优化和架构使PanGu--1B Pro在基准评估集上平均提升8.87。此外,PanGu--1.5B Pro超越了多个具有更大模型规模的SOTA模型,验证了其优越性能。代码可在https://github.com/YuchuanTian/RethinkTinyLM获取。
引用
@article{arxiv.2402.02791,
title = {PanGu-$\pi$ Pro:Rethinking Optimization and Architecture for Tiny Language Models},
author = {Yehui Tang and Kai Han and Fangcheng Liu and Yunsheng Ni and Yuchuan Tian and Zheyuan Bai and Yi-Qi Hu and Sichao Liu and Shangling Jui and Yunhe Wang},
journal= {arXiv preprint arXiv:2402.02791},
year = {2025}
}