分段二值化与准结构化剪枝用于大型语言模型
机器学习
2025-09-30 v4
摘要
大型语言模型(LLM)在自然语言处理领域取得了显著进展,但其高计算和内存成本阻碍了在资源受限设备上的部署。二值化是量化的最极端形式,但二值化模型仍包含可进一步删除的冗余。剪枝提供了一种自然的消除冗余方式,但 naive 组合二值化和剪枝常导致严重的性能下降。本文提出分段二值化与准结构化剪枝(PBSP),一种 novel post-training 框架,将二值化和准结构化剪枝无缝集成。我们首先提出基于二值化优化的分步准结构化剪枝(SPBO),逐步引入稀疏性,同时优化二值化参数,以联合减少剪枝和量化误差,实现更稳定和准确的压缩。此外,我们提出粗到细搜索(CFS),首先分配剪枝比例,然后细化元素选择,进一步提升整体性能。广泛实验显示,PBSP在囊惑度和下游准确性方面 consistently 优于现有最先进(SOTA)二进制后训练量化方法。代码和模型将在https://github.com/XIANGLONGYAN/PBS2P提供。
引用
@article{arxiv.2502.01705,
title = {Progressive Binarization with Semi-Structured Pruning for LLMs},
author = {Xianglong Yan and Tianao Zhang and Zhiteng Li and Haotong Qin and Yulun Zhang},
journal= {arXiv preprint arXiv:2502.01705},
year = {2025}
}