中文

面向LLM深度压缩的局部感知冗余剪枝

机器学习 2026-05-28 v1 人工智能

摘要

大型语言模型已知在网络深度上存在表示冗余,这使得深度剪枝成为提高推理效率的有效方法。现有的单次剪枝方法依赖于局部层重要性或跨架构的固定冗余假设。我们提出了局部感知冗余剪枝(LoRP),一种由表示局部性引导的、无需训练的单次深度剪枝框架。我们表明,层间冗余可以是局部化的,也可以是全局分布的,具体取决于LLM架构。为了表征这一现象,我们引入了表示局部性分数(RLS),它源自全局层间隐藏状态相似性。使用一个小型校准集,LoRP计算成对层相似性,根据表示相似性对层进行聚类,并根据残差簇内冗余分配剪枝。在多种LLM家族上的实验表明,在困惑度和下游任务准确性上均有改进。

关键词

引用

@article{arxiv.2605.27786,
  title  = {Locality-Aware Redundancy Pruning for LLM Depth Compression},
  author = {Vincent-Daniel Yun and Youngrae Kim and Woosang Lim and YoungJin Heo and Minkyu Kim and Sunwoo Lee},
  journal= {arXiv preprint arXiv:2605.27786},
  year   = {2026}
}