EfficientLLM:面向架构无关性边缘语言模型的可扩展剪枝感知预训练
机器学习
2025-02-13 v2
摘要
现代大型语言模型(LLM)受益于规模定律,实现了在大型模型规模上的智能突破。最近,关于云端成本、延迟和隐私的日益增长的关注,使得开发紧凑型边缘语言模型成为迫切需求。与受限于规模定律的直接预训练不同,本工作提出了剪枝感知预训练,专注于保留来自更大优化模型的性能。它具有以下特征:1)数据可扩展:我们在LLM中引入最小参数组,持续优化结构剪枝,将后训练剪枝方法如 LLM-Pruner 和 SparseGPT 扩展到预训练阶段。2)架构无关:LLM 架构通过显著性驱动剪枝自动设计,这是首次超越现代预训练中 SoTA 人类设计的 LLM。我们揭示,通过扩展 LLM 压缩并扩大其边界,EfficientLLM 实现了顶级边缘语言模型。与 SoTA 基线如 MobileLLM、SmolLM、Qwen2.5-0.5B、OLMo-1B、Llama3.2-1B 在常识基准测试中显著优于。作为首次尝试,EfficientLLM 弥合了传统 LLM 压缩与直接预训练方法之间的性能差距。我们将在 https://github.com/Xingrun-Xing2/EfficientLLM 完全开源。
引用
@article{arxiv.2502.06663,
title = {EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models},
author = {Xingrun Xing and Zheng Liu and Shitao Xiao and Boyan Gao and Yiming Liang and Wanpeng Zhang and Haokun Lin and Guoqi Li and Jiajun Zhang},
journal= {arXiv preprint arXiv:2502.06663},
year = {2025}
}