通过贝叶斯优化实现大语言模型的自适应特征基低秩压缩
计算与语言
2025-02-25 v2 机器学习
摘要
近年来,大语言模型(LLM)推动了自然语言处理领域的进展。然而,其规模的不断增长加剧了计算负担,迫切需要在效率和性能之间进行平衡。低秩压缩作为一种有前景的技术,通过将权重矩阵分解为两个低秩矩阵的乘积来减少非本征参数。然而,其在LLM中的应用尚未广泛研究。低秩压缩的关键在于低秩分解和低秩维度的分配。为解决LLM低秩压缩的挑战,我们对大型模型的低秩特征进行了实证研究。我们提出了一种适用于LLM的低秩压缩方法。该方法涉及通过池化协方差矩阵对特征分布进行精确估计,以及针对低秩维度分配的贝叶斯优化策略。在LLaMA-2模型上的实验表明,我们的方法在相同压缩比下,优于现有的强大的结构化剪枝和低秩压缩技术。
引用
@article{arxiv.2405.10616,
title = {Adaptive Feature-based Low-Rank Compression of Large Language Models via Bayesian Optimization},
author = {Yixin Ji and Yang Xiang and Juntao Li and Qingrong Xia and Zi Ye and Xinyu Duan and Zhefeng Wang and Kehai Chen and Min Zhang},
journal= {arXiv preprint arXiv:2405.10616},
year = {2025}
}
备注
Published as a conference paper at 2024 EMNLP findings