表示维度如何主导结构剪枝后的 LLM?
机器学习
2025-03-07 v1
摘要
剪枝假设原始深度神经网络中存在一个子网络,可以以更少的计算实现与原始模型相当的性能。然而,不同子网络提取方式下的模型性能如何变化尚不清楚。本文选择表示维度(或嵌入维度、模型维度、相关文献中的残差流维度)作为研究这一问题的切入点。本文研究了 LLM transformer 块中的线性变换,并考虑了一种特定的结构化剪枝方法 SliceGPT,以提取不同表示维度的子网络。本文机制性地分析了模型前向传播期间的激活流,发现表示维度主导了线性变换、模型预测,最终主导了模型性能。给出了显式的解析关系式,用于在不实际评估的情况下计算剪枝后模型的性能(困惑度和准确率),并在 Llama-3-8B-Instruct 和 Phi-3-mini-4k-Instruct 上进行了实证验证。
引用
@article{arxiv.2503.04377,
title = {How can representation dimension dominate structurally pruned LLMs?},
author = {Mingxue Xu and Lisa Alazraki and Danilo P. Mandic},
journal= {arXiv preprint arXiv:2503.04377},
year = {2025}
}
备注
ICLR 2025 Workshop on Sparsity in LLMs (SLLM)