CLOVER:跨层正交向量剪枝与微调
机器学习
2025-02-03 v3 人工智能
摘要
解码器模型通过缓存键/值向量来自回归生成标记,但随着缓存的增长,推理过程变得内存受限。为此,我们提出了 CLOVER(Cross-Layer Orthogonal Vectors),一种新方法,将注意力层的成对视为一组低秩分解。CLOVER 对每个注意力头中的 Q-K 和 V-O 配对应用奇异值分解(SVD)。 resulting 的奇异值要么用于指导剪枝,要么作为所有正交向量的可训练参数,用于高效微调。剪枝或微调后,这些值被重新集成到模型中,而不会增加其参数数量。我们将 CLOVER 应用于各种模型,包括 GPT-2 XL、DeepSeek-V2-Lite、Whisper-Large-v3、Stable Diffusion XL 和 LLaMA-3.2-11B-Vision。我们的结果表明,CLOVER 在剪枝效率方面显著优于其他方法。例如,对 GPT-2 XL 70% 的 Q-K 配对进行剪枝,其困惑度与仅剪枝 8% 的传统方法相当。进一步对奇异值进行微调可实现完整秩更新, 在 LLaMA-2 7B 上 outperform 了最先进的方法(LoRA、DoRA、HiRA 和 PiSSA)分别提高了 7.6%、5.5%、3.8% 和 0.7%。
引用
@article{arxiv.2411.17426,
title = {CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning},
author = {Fanxu Meng and Pingzhi Tang and Fan jiang and Muhan Zhang},
journal= {arXiv preprint arXiv:2411.17426},
year = {2025}
}
备注
https://github.com/GraphPKU/PiSSA