中文

神经网络组件无损压缩:权重、检查点与 KV 缓存的低精度格式

机器学习 2025-08-28 v1 人工智能 神经与进化计算

摘要

随着深度学习模型的规模不断扩大和部署的广泛化,减少神经网络权重的存储和传输成本变得越来越重要。虽然已有工作如 ZipNN 表明,无损压缩方法——尤其是基于 Huffman 编码浮点指数的压缩方法—can显著减少模型大小,但这些技术主要应用于更高精度格式,如 FP32 和 BF16。本文将 ZipNN 方法扩展到更低精度的浮点格式,即 FP8 和 FP4,这些格式正因高效推理而日益流行。我们设计了一种将指数和尾数分离并独立进行熵编码压缩的方法。我们的评估显示,BF16 的压缩比率可达 62%,FP8 的压缩比率可达 83%。我们还研究了大型语言模型(LLM)中用于存储关键值(K/V)缓存张量的可压缩性,发现它们同样具有可压缩模式,能够在部署时实现内存节省。

关键词

引用

@article{arxiv.2508.19263,
  title  = {Lossless Compression of Neural Network Components: Weights, Checkpoints, and K/V Caches in Low-Precision Formats},
  author = {Anat Heilper and Doron Singer},
  journal= {arXiv preprint arXiv:2508.19263},
  year   = {2025}
}

备注

16 pages 9 images