Minitron 方法下的 LLM 剪枝与蒸馏实践
计算与语言
2024-12-10 v4 人工智能
机器学习
摘要
我们报告了将 Llama 3.1 8B 和 Mistral NeMo 12B 模型压缩至 4B 和 8B 参数的做法,分别采用剪枝和蒸馏。我们探索了两种不同的剪枝策略:(1)深度剪枝和(2)联合隐藏层/注意力/MLP(宽度)剪枝,并在来自 LM Evaluation Harness 的常见基准上进行评估。随后,模型经 NeMo Aligner 对齐后进行测试,其指令调优版本亦得到验证。该方法为 Llama 3.1 8B 生产出引人注目的 4B 模型,以及从 Mistral NeMo 12B 生产出最先进的 Mistral-NeMo-Minitron-8B(简称 MN-Minitron-8B)模型。我们发现,在没有访问原始数据的情况下,对教师模型在蒸馏数据集上进行轻微微调是有益的。我们将发布我们的基础模型权重至 Hugging Face,采用宽松许可证。
引用
@article{arxiv.2408.11796,
title = {LLM Pruning and Distillation in Practice: The Minitron Approach},
author = {Sharath Turuvekere Sreenivas and Saurav Muralidharan and Raviraj Joshi and Marcin Chochowski and Ameya Sunil Mahabaleshwarkar and Gerald Shen and Jiaqi Zeng and Zijia Chen and Yoshi Suhara and Shizhe Diao and Chenhan Yu and Wei-Chun Chen and Hayley Ross and Oluwatobi Olabiyi and Ashwath Aithal and Oleksii Kuchaiev and Daniel Korzekwa and Pavlo Molchanov and Mostofa Patwary and Mohammad Shoeybi and Jan Kautz and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2408.11796},
year = {2024}
}
备注
v4: Update author order