优势参数扩展训练构建更优的大语言模型
计算与语言
2025-06-02 v1
摘要
尽管在预训练和微调中增加可训练参数的数量可以有效提升大语言模型的性能,但这也导致了计算开销的增加。在深入探究参数差异时,我们发现一部分被称为“优势参数”的参数在决定模型性能方面起着至关重要的作用。进一步分析表明,更强的模型往往拥有更多此类参数。在本文中,我们提出了优势参数扩展训练(APEX),该方法将优势参数逐步扩展至劣势参数的空间中,从而提高其比例并增强训练效果。从矩阵有效秩角度进行的进一步理论分析解释了APEX带来的性能提升。在指令微调和持续预训练上的大量实验表明,在指令微调中,APEX仅使用52%的可训练参数便优于全参数微调。在持续预训练中,APEX仅使用33%的训练数据便达到了与常规训练相同的困惑度水平,并在下游任务上取得了显著提升。
引用
@article{arxiv.2505.24241,
title = {Advantageous Parameter Expansion Training Makes Better Large Language Models},
author = {Naibin Gu and Yilong Chen and Zhenyu Zhang and Peng Fu and Zheng Lin and Shuohuan Wang and Yu Sun and Hua Wu and Weiping Wang and Haifeng Wang},
journal= {arXiv preprint arXiv:2505.24241},
year = {2025}
}