模型修剪与知识蒸馏 improved 方法
计算与语言
2025-05-21 v1 计算工程、金融与科学
摘要
模型修剪是大型语言模型(如 R1 或 o3-mini)的性能优化技术。然而,现有修剪方法常导致显著性能下降,或需要 extensive retraining 和 fine-tuning。该技术旨在识别和删除在人机交互阶段不太可能产生贡献的神经元、连接。我们的目标是获得一个 much smaller and faster knowledge distilled model,使其能够快速生成内容,几乎与未修剪的模型相当。我们提出了 MAMA Pruning,即 Movement and Magnitude Analysis 的缩写,这是一种改进的修剪方法,有效减少模型规模和计算复杂度,同时保持与原始未修剪模型相当的性能,即使在极端修剪水平下也能做到。改进方法基于预训练阶段固定的权重、偏置以及后训练阶段验证的 GRPO rewards 作为我们的 novel pruning indicators。初步实验结果表明,我们的方法在 various pruning levels 和不同的下游计算语言学任务上超越并与 SOTA 方法相当。
关键词
引用
@article{arxiv.2505.14052,
title = {Improved Methods for Model Pruning and Knowledge Distillation},
author = {Wei Jiang and Anying Fu and Youling Zhang},
journal= {arXiv preprint arXiv:2505.14052},
year = {2025}
}