生成式语言模型结构化剪枝中的关键因素是什么?
计算与语言
2023-02-09 v1 机器学习
摘要
诸如 GPT-3 之类的自回归大语言模型(LLM)在使用时需要庞大的计算资源。传统上,采用结构化剪枝方法来降低资源消耗。然而,它们在生成式语言模型上的应用与有效性尚未得到充分探索。本文对 GPT 类模型前馈层中常见的结构化剪枝方法(包括幅度剪枝、随机剪枝和移动剪枝)进行了全面评估。出乎意料的是,在多个自然语言生成任务中,随机剪枝的性能与已有最佳方法相当。为理解这些结果,我们提供了一个框架来衡量由不同方法剪枝后模型的神经元级冗余度,并发现已有的结构化剪枝方法未考虑神经元的独特性,留下了过多的冗余。有鉴于此,我们引入全局唯一移动(GUM)以提升剪枝后模型中神经元的唯一性。随后我们讨论了我们的技术对不同冗余度量的影响,以解释性能的提升。
引用
@article{arxiv.2302.03773,
title = {What Matters In The Structured Pruning of Generative Language Models?},
author = {Michael Santacroce and Zixin Wen and Yelong Shen and Yuanzhi Li},
journal= {arXiv preprint arXiv:2302.03773},
year = {2023}
}