中文

Thanos:面向大语言模型压缩的块状剪枝算法

机器学习 2025-04-09 v1 人工智能 计算与语言 性能

摘要

本文提出Thanos,一种 novel 权重剪枝算法,用于减少大型语言模型(LLM)的内存占用和计算效率,同时保持准确率。Thanos引入块状剪枝策略,配合自适应掩码,动态调整以权重重要性为依据,实现灵活的稀疏模式和结构化格式(如n:mn:m稀疏),针对硬件加速进行优化。实验评估表明,Thanos在结构化剪枝方面实现了最先进的性能,优于现有方法在非结构化剪枝中的表现。通过提供一种高效且可适应的模型压缩方法,Thanos为在资源受限环境中部署大型模型提供了实用解决方案。

关键词

引用

@article{arxiv.2504.05346,
  title  = {Thanos: A Block-wise Pruning Algorithm for Efficient Large Language Model Compression},
  author = {Ivan Ilin and Peter Richtarik},
  journal= {arXiv preprint arXiv:2504.05346},
  year   = {2025}
}

备注

8 pages, 3 Figures, 3 Tables, 2 Algorithms, paper comes with Appendix