面向注意力的分析低秩逼近框架 A3
计算与语言
2026-05-14 v4 人工智能
机器学习
摘要
大型语言模型已展现出惊人的性能;然而,其巨大的参数数量使得部署成本极高。低秩逼近提供了一条有前景的压缩解决方案,但现有方法存在两个主要局限性:(1) 它们关注最小化单个线性层的输出误差,而不考虑 Transformer 的架构特征;(2) 它们将较大的权重矩阵分解为两个较小的低秩矩阵。因此,这些方法往往远远不及剪枝和量化等其他压缩技术,还会引入运行时开销,例如额外的 GEMM 内核启动和用于分解小矩阵的内存操作。为此,我们提出了 ,一种后训练低秩逼近框架。 将 Transformer 层分为三个功能组件,即 、 和 ,并提供解析解,在最小化各组件功能损失的同时,减少每个组件内部的隐藏维度大小。该方法直接减少了模型大小、KV 缓存大小和 FLOPs,而不会引入任何运行时开销。通过大量实验,我们展示了 在性能上优于 SoTA。例如,在相同的计算和内存削减预算下,我们的低秩近似 LLaMA 3.1-70B 在 WikiText-2 上实现了 4.69 的 perplexity,超越了 previous SoTA 的 7.87,提高了 3.18。我们还展示了 在 KV 缓存压缩、与量化集成、微调和混合秩分配中的多样化应用。我们开源了我们的框架和代码,地址为 https://github.com/DeepWok/a3。
引用
@article{arxiv.2505.12942,
title = {A3 : an Analytical Low-Rank Approximation Framework for Attention},
author = {Jeffrey T. H. Wong and Cheng Zhang and Xinye Cao and Pedro Gimenes and Christos-Savvas Bouganis and George A. Constantinides and Wayne Luk and Yiren Zhao},
journal= {arXiv preprint arXiv:2505.12942},
year = {2026}
}