中文

LLM 中的激活压缩:理论分析与高效算法

机器学习 2026-05-05 v1

摘要

训练大型语言模型(LLMs)计算开销极大,必须存储权重、优化器状态以及反向传播所需的中间激活值。虽然现有内存高效方法主要针对梯度和优化器状态,但由于缺乏针对 LLM 的理论支持,激活压缩尚不成熟。本文构建了理论框架,表明在激活压缩无偏时,对线性算子安全,但对非线性算子则可能存在问题。进一步推导梯度方差上界,建立了在标准 LL-光滑性假设下,对所有线性算子应用激活压缩的收敛保证,表明其不会改变收敛率。基于理论,我们提出一种激活-梯度共压缩方法,通过复用低秩激活因子,在不额外计算或增加梯度误差的情况下压缩线性层梯度。我们在 Qwen 和 LLaMA 模型上使用预训练基准和多个微调基准进行实验,验证了理论并展示了方法在准确率和压缩效率方面的竞争性能。我们在补充材料中提供代码以便复现。

关键词

引用

@article{arxiv.2605.01255,
  title  = {Activation Compression in LLMs: Theoretical Analysis and Efficient Algorithm},
  author = {Wen-Da Wei and Han-Bin Fang and Yang-Di Liu and Jiang-Xin Shi and James Kwok and Yu-Feng Li},
  journal= {arXiv preprint arXiv:2605.01255},
  year   = {2026}
}