通过激活感知初始化实现大语言模型的推理保留高效蒸馏
计算与语言
2026-05-29 v1 机器学习
摘要
高效蒸馏 (EDistill) 通过结构化剪枝参数并调校轻量级模块来压缩大型语言模型 (LLM),具有高训练效率。尽管这些 EDistilled LLM 在与相似规模 LLM 相比的通用能力基准上实现了最先进 (SOTA) 性能,但我们发现其在多步骤推理能力上存在严重退化,称为推理坍塌。我们系统性地分析了推理坍塌的几何起源,表明基于宽度降低投影矩阵的 SOTA EDistill 方法受益于 eRank 坍塌,即隐藏表示的有效秩 (eRank) 下降。我们理论上解释了随机初始化投影矩阵的奇异值分布不均导致 eRank 坍塌,从而引起 token 不可区分性。为解决此问题,我们提出了 RED (Reasoning-preserved Efficient Distillation),为 LLM 引入激活感知初始化,将投影矩阵初始化为通道选择矩阵,从而在理论上缓解 eRank 坍塌。在 Llama 和 Qwen 系列模型上的实验表明,RED 在保持高训练效率和 SOTA 通用能力的同时,显著恢复了推理能力。
引用
@article{arxiv.2605.29327,
title = {Reasoning-preserved Efficient Distillation of Large Language Models via Activation-aware Initialization},
author = {Junlin He and Yihong Tang and Tong Nie and Guilong Li and Binyu Yang and Jinxiao Du and Lijun Sun and Wei Ma},
journal= {arXiv preprint arXiv:2605.29327},
year = {2026}
}