中文

QET:通过元素置换和残差聚类提升量化 LLM 参数和 KV 缓存压缩

机器学习 2024-09-09 v4 计算与语言

摘要

矩阵量化涉及以更节省空间的方式表示矩阵元素,以减少存储用量,量化后的矩阵通过反量化恢复原始矩阵以供使用。我们将量化误差最小化(QEM)问题形式化为在量化后矩阵占用相同内存空间的条件下,最小化原始矩阵与量化后矩阵之间的距离。矩阵量化在诸多应用中至关重要,包括大型语言模型(LLM)权重量化、向量数据库、KV 缓存量化、图形压缩以及图像压缩。近期涌现的 LLM 如 GPT-4 和 BERT,凸显了由于参数和 KV 缓存以矩阵形式存储的庞大规模,对矩阵压缩的重要性。我们提出量子纠缠树(QET)以解决 QEM 问题,借助矩阵元素局部有序性,通过迭代元素置换形成局部有序矩阵。此后对该矩阵按列分组量化。为进一步提升 QET,我们引入两种优化:进一步量化残差以降低均方误差(MSE),以及使用掩码和批量处理加速算法。实验结果表明,QET 在 LLM 数据集、K 缓存和 V 缓存上的均方误差分别可降低至当前最佳方法的 5.05%、13.33% 和 11.89%。我们的贡献包括对 QEM 问题的抽象、QET算法的设计,以及两种提升精度和速度的优化方案。

关键词

引用

@article{arxiv.2407.03637,
  title  = {QET: Enhancing Quantized LLM Parameters and KV cache Compression through Element Substitution and Residual Clustering},
  author = {Yanshu Wang and Wang Li and Zhaoqian Yao and Tong Yang},
  journal= {arXiv preprint arXiv:2407.03637},
  year   = {2024}
}