压缩的代价:探究压缩对语言模型参数化知识的影响
计算与语言
2023-12-05 v1 人工智能
机器学习
摘要
压缩大型语言模型(LLM)(通常包含数十亿参数)可实现更快的推理、更小的内存占用,并支持本地部署。两种标准的压缩技术是剪枝(pruning)与量化(quantization):前者消除模型层中的冗余连接,后者用更少的比特表示模型参数。其核心权衡在于压缩程度与对压缩模型质量的影响之间。现有 LLM 压缩研究主要关注以困惑度或下游任务准确率等通用指标衡量的性能,而衡量参数化知识等更细粒度的指标仍显著缺乏探索。为弥补这一空白,我们跨多个模型族(ENCODER、ENCODER-DECODER 与 DECODER),使用 LAMA 与 LM-HARNESS 基准进行综合分析,以系统量化常用压缩技术对模型性能的影响。特别关注涉及参数化知识的权衡,旨在为从业者在压缩决策中提供实用洞见。我们发布了代码库以促进后续研究。
引用
@article{arxiv.2312.00960,
title = {The Cost of Compression: Investigating the Impact of Compression on Parametric Knowledge in Language Models},
author = {Satya Sai Srinath Namburi and Makesh Sreedhar and Srinath Srinivasan and Frederic Sala},
journal= {arXiv preprint arXiv:2312.00960},
year = {2023}
}
备注
Accepted to EMNLP 2023 Findings