表征语言模型中低秩分解的精度-效率权衡
机器学习
2024-10-24 v2 计算与语言
摘要
最近的大型语言模型(LLM)采用数十亿参数来实现广泛的解决问题能力。由于低算术强度的矩阵-向量和矩阵-矩阵乘法占主导地位,此类语言模型也往往受限于内存带宽。因此,优化内存占用和流量是当今LLM的一个重要优化方向。模型压缩方法,如量化和参数剪枝,已被积极探索以实现内存占用和流量优化。然而,对于LLM而言,秩剪枝(即低秩分解)的精度-效率权衡尚未被充分理解。因此,在本工作中,我们表征了一种低秩分解方法,特别是Tucker分解,在近期语言模型(包括开源LLM Llama 2)上的精度-效率权衡。我们形式化了低秩分解设计空间,并表明该分解设计空间是巨大的(例如,对于Llama2-7B为O())。为了导航如此庞大的设计空间,我们对其进行了公式化表述,并使用六个广泛使用的LLM基准测试,在BERT和Llama 2模型上对精度-效率权衡进行了详尽的案例研究。我们的结果表明,我们可以在不进行任何重新训练以恢复分解后精度的情况下,实现9%的模型尺寸缩减,而精度下降极小,根据基准测试的难度,下降范围从4%p(%p指“百分点”,表示两个百分比数字之间的绝对差值;74% -> 78% = 4%p增加)到10%p。结果表明,低秩分解对于需要大规模实时服务的基于LLM的应用(例如,AI智能体和实时编码助手)可能是一个有前景的方向,在这些应用中,延迟与模型精度同等重要。
引用
@article{arxiv.2405.06626,
title = {Characterizing the Accuracy -- Efficiency Trade-off of Low-rank Decomposition in Language Models},
author = {Chakshu Moar and Faraz Tahmasebi and Michael Pellauer and Hyoukjun Kwon},
journal= {arXiv preprint arXiv:2405.06626},
year = {2024}
}