面向LLM深度压缩的局部感知冗余剪枝
机器学习
2026-05-28 v1 人工智能
摘要
大型语言模型已知在网络深度上存在表示冗余,这使得深度剪枝成为提高推理效率的有效方法。现有的单次剪枝方法依赖于局部层重要性或跨架构的固定冗余假设。我们提出了局部感知冗余剪枝(LoRP),一种由表示局部性引导的、无需训练的单次深度剪枝框架。我们表明,层间冗余可以是局部化的,也可以是全局分布的,具体取决于LLM架构。为了表征这一现象,我们引入了表示局部性分数(RLS),它源自全局层间隐藏状态相似性。使用一个小型校准集,LoRP计算成对层相似性,根据表示相似性对层进行聚类,并根据残差簇内冗余分配剪枝。在多种LLM家族上的实验表明,在困惑度和下游任务准确性上均有改进。
引用
@article{arxiv.2605.27786,
title = {Locality-Aware Redundancy Pruning for LLM Depth Compression},
author = {Vincent-Daniel Yun and Youngrae Kim and Woosang Lim and YoungJin Heo and Minkyu Kim and Sunwoo Lee},
journal= {arXiv preprint arXiv:2605.27786},
year = {2026}
}