中文

基于凸优化的语言模型层级后训练剪枝器

机器学习 2024-08-08 v1 最优化与控制

摘要

剪枝是压缩已训练大语言模型(LLM)的关键策略,旨在不损失性能的情况下实现显著的内存节省和计算加速。然而,现有剪枝方法往往需要对大规模LLM进行低效的再训练,或依赖诸如最优大脑外科框架等启发式方法,导致性能下降。本文引入FISTAPruner,即首个基于凸优化模型和算法的后训练剪枝器。具体而言,我们提出一种包含 1 \ell_1 范数的凸优化模型以诱导出稀疏性,并利用FISTA求解器进行优化。FISTAPruner包含层内累积误差校正机制,支持并行剪枝。我们在包括OPT、LLaMA、LLaMA-2和LLaMA-3等模型上进行了全面评估,参数规模从125万到70亿不等,在无结构和2:4半结构稀疏性下,证明其在各种语言基准测试中优于现有最先进方法。

关键词

引用

@article{arxiv.2408.03728,
  title  = {A Convex-optimization-based Layer-wise Post-training Pruner for Large Language Models},
  author = {Pengxiang Zhao and Hanyu Hu and Ping Li and Yi Zheng and Zhefeng Wang and Xiaoming Yuan},
  journal= {arXiv preprint arXiv:2408.03728},
  year   = {2024}
}