中文

通过贝叶斯优化实现大语言模型的自适应特征基低秩压缩

计算与语言 2025-02-25 v2 机器学习

摘要

近年来,大语言模型(LLM)推动了自然语言处理领域的进展。然而,其规模的不断增长加剧了计算负担,迫切需要在效率和性能之间进行平衡。低秩压缩作为一种有前景的技术,通过将权重矩阵分解为两个低秩矩阵的乘积来减少非本征参数。然而,其在LLM中的应用尚未广泛研究。低秩压缩的关键在于低秩分解和低秩维度的分配。为解决LLM低秩压缩的挑战,我们对大型模型的低秩特征进行了实证研究。我们提出了一种适用于LLM的低秩压缩方法。该方法涉及通过池化协方差矩阵对特征分布进行精确估计,以及针对低秩维度分配的贝叶斯优化策略。在LLaMA-2模型上的实验表明,我们的方法在相同压缩比下,优于现有的强大的结构化剪枝和低秩压缩技术。

关键词

引用

@article{arxiv.2405.10616,
  title  = {Adaptive Feature-based Low-Rank Compression of Large Language Models via Bayesian Optimization},
  author = {Yixin Ji and Yang Xiang and Juntao Li and Qingrong Xia and Zi Ye and Xinyu Duan and Zhefeng Wang and Kehai Chen and Min Zhang},
  journal= {arXiv preprint arXiv:2405.10616},
  year   = {2025}
}

备注

Published as a conference paper at 2024 EMNLP findings