中文

P$^2$ 定律:模型剪枝后的后训练缩放规律

人工智能 2025-05-27 v3 计算与语言 机器学习

摘要

剪枝已成为降低大型语言模型(LLM)硬件需求的广泛采纳技术。为了恢复剪枝后的模型性能,通常会采用后训练技术来缓解随之而来的性能下降。尽管后训练受益于更大的数据集,但一旦数据集已非常庞大,增加训练数据仅能提供有限的性能提升。为平衡后训练成本与模型性能,有必要探索后训练所需数据的优化量。通过对Llama-3和Qwen-2.5系列模型进行大量实验,发现了后训练缩放规律——称为P2^2定律。该定律确定了预测剪枝后模型后训练损失的四个关键因素:剪枝前的模型规模、后训练标记数、剪枝率以及模型在剪枝前的损失。此外,P2^2定律能够推广到更大的数据集规模、更大的模型规模和更高的剪枝率,为剪枝后LLM的后训练提供了宝贵的见解。

关键词

引用

@article{arxiv.2411.10272,
  title  = {P$^2$ Law: Scaling Law for Post-Training After Model Pruning},
  author = {Xiaodong Chen and Yuxuan Hu and Xiaokang Zhang and Yanling Wang and Cuiping Li and Hong Chen and Jing Zhang},
  journal= {arXiv preprint arXiv:2411.10272},
  year   = {2025}
}

备注

Accepted as Main of ACL2025