中文

UNComp:矩阵熵能否揭示稀疏性?——基于不确定性感知的压缩器设计

计算与语言 2025-09-25 v2 机器学习

摘要

部署大型语言模型(LLM)进行长上下文推理面临着巨大的内存和计算需求。虽然已开发了诸如键值(KV)缓存压缩等技术来减少内存使用,但这些技术常常忽略了隐藏状态与其相应KV缓存之间固有的结构稀疏性。本文探讨了不确定性作为稀疏性潜在指示器的作用。我们提出了UNComp框架,利用截断矩阵熵识别低信息内容的区域,从而揭示可用于自适应压缩的稀疏性模式。与传统方法不同,UNComp动态地调整压缩方法,由不确定性测度指导,以反映各模型组件重要性。我们的分析表明,基于不确定性估计导出的稀疏性模式可被用来揭示特殊的长程依赖关系,如检索头和检索层。这种视角不仅增强了我们如何优化压缩的理解,还为我们洞察LLM在长上下文推理期间内在稀疏性提供了新见解。通过关注不确定性对稀疏性模式的详细分析,UNComp将KV缓存大小缩小至原始大小的4.74%,实现6%的预填加速,并提升吞吐量达6.4倍——不仅提供强大的无损压缩性能,还验证了底层理论工具的有效性。我们在https://github.com/menik1126/UNComp上发布了代码。

关键词

引用

@article{arxiv.2410.03090,
  title  = {UNComp: Can Matrix Entropy Uncover Sparsity? -- A Compressor Design from an Uncertainty-Aware Perspective},
  author = {Jing Xiong and Jianghan Shen and Fanghua Ye and Chaofan Tao and Zhongwei Wan and Jianqiao Lu and Xun Wu and Chuanyang Zheng and Zhijiang Guo and Min Yang and Lingpeng Kong and Ngai Wong},
  journal= {arXiv preprint arXiv:2410.03090},
  year   = {2025}
}

备注

Accepted at EMNLP 2025 (Main Conference)