P$^2$ 定律:模型剪枝后的后训练缩放规律
人工智能
2025-05-27 v3 计算与语言
机器学习
摘要
剪枝已成为降低大型语言模型(LLM)硬件需求的广泛采纳技术。为了恢复剪枝后的模型性能,通常会采用后训练技术来缓解随之而来的性能下降。尽管后训练受益于更大的数据集,但一旦数据集已非常庞大,增加训练数据仅能提供有限的性能提升。为平衡后训练成本与模型性能,有必要探索后训练所需数据的优化量。通过对Llama-3和Qwen-2.5系列模型进行大量实验,发现了后训练缩放规律——称为P定律。该定律确定了预测剪枝后模型后训练损失的四个关键因素:剪枝前的模型规模、后训练标记数、剪枝率以及模型在剪枝前的损失。此外,P定律能够推广到更大的数据集规模、更大的模型规模和更高的剪枝率,为剪枝后LLM的后训练提供了宝贵的见解。
引用
@article{arxiv.2411.10272,
title = {P$^2$ Law: Scaling Law for Post-Training After Model Pruning},
author = {Xiaodong Chen and Yuxuan Hu and Xiaokang Zhang and Yanling Wang and Cuiping Li and Hong Chen and Jing Zhang},
journal= {arXiv preprint arXiv:2411.10272},
year = {2025}
}
备注
Accepted as Main of ACL2025