基于滑动窗口合并的LLM中压缩冗余深度层
计算机视觉与模式识别
2026-03-20 v4
摘要
深度剪枝在资源受限的场景中可加速LLM推理,但由于直接删除整个Transformer层而导致性能下降。本文通过分析Transformer不同层输出在再生核希尔伯特空间中的相关性,揭示了“类patch”冗余跨层的存在,表明连续层具有高度的功能相似性。基于此观察,本文提出了滑动窗口合并(SWM)——一种动态压缩方法,通过预定义的相似性阈值从上到下选择连续层,并通过参数整合来压缩冗余层,从而在保持性能的同时简化模型结构。在各种架构和不同参数规模的LLM上进行的广泛实验表明,我们的方法在零样推理性能和剪枝后重新训练恢复质量方面均优于现有剪枝技术。特别是在对Vicuna-7B模型进行35%剪枝的实验中,我们的方法在零样任务上的平均性能提升了1.654%。此外,我们进一步揭示了将深度剪枝与宽度剪枝结合以增强剪枝效果的潜力。我们的代码已公开:https://github.com/920927/SLM-a-sliding-layer-merging-method。
引用
@article{arxiv.2502.19159,
title = {Sliding-Window Merging for Compacting Patch-Redundant Layers in LLMs},
author = {Xuan Ding and Rui Sun and Yunjian Zhang and Xiu Yan and Yueqi Zhou and Kaihao Huang and Suzhong Fu and Angelica I Aviles-Rivero and Chuanlong Xie and Yao Zhu},
journal= {arXiv preprint arXiv:2502.19159},
year = {2026}
}