中文

分段二值化与准结构化剪枝用于大型语言模型

机器学习 2025-09-30 v4

摘要

大型语言模型(LLM)在自然语言处理领域取得了显著进展,但其高计算和内存成本阻碍了在资源受限设备上的部署。二值化是量化的最极端形式,但二值化模型仍包含可进一步删除的冗余。剪枝提供了一种自然的消除冗余方式,但 naive 组合二值化和剪枝常导致严重的性能下降。本文提出分段二值化与准结构化剪枝(PBS2^2P),一种 novel post-training 框架,将二值化和准结构化剪枝无缝集成。我们首先提出基于二值化优化的分步准结构化剪枝(SPBO),逐步引入稀疏性,同时优化二值化参数,以联合减少剪枝和量化误差,实现更稳定和准确的压缩。此外,我们提出粗到细搜索(CFS),首先分配剪枝比例,然后细化元素选择,进一步提升整体性能。广泛实验显示,PBS2^2P在囊惑度和下游准确性方面 consistently 优于现有最先进(SOTA)二进制后训练量化方法。代码和模型将在https://github.com/XIANGLONGYAN/PBS2P提供。

关键词

引用

@article{arxiv.2502.01705,
  title  = {Progressive Binarization with Semi-Structured Pruning for LLMs},
  author = {Xianglong Yan and Tianao Zhang and Zhiteng Li and Haotong Qin and Yulun Zhang},
  journal= {arXiv preprint arXiv:2502.01705},
  year   = {2025}
}