中文

受限边缘 AI 部署:LLM 压缩中的微调 vs 蒸馏

机器学习 2025-05-27 v1

摘要

现代基础模型通常通过结构化剪枝和再训练进行压缩,以满足边缘部署中严格的计算、内存和连接约束。虽然最先进的剪枝方案针对整个 Transformer,但我们采用仅对 MLP 块进行单层 L2 范数剪枝作为固定基线。我们的重点不在于实现最大压缩,而是在隔离再训练损失函数的影响:(i) 使用交叉熵进行微调 (L2PFT),需要标签数据;或 (ii) 使用 KL 散度进行自蒸馏 (L2PSD),仅利用教师 logits(无标签)(L2PSD)。我们在适用于边缘网络中间接或被拒绝连接场景的 CommonsenseQA 上评估两个管道,使用 OLMo2-7B-SFT 模型。在相同的剪枝计划下,KL 基于的蒸馏在测试准确率上匹配或优于 CE 微调,表明即使在仅进行基础 MLP 剪枝的情况下,损失函数的选择在资源受限环境下对压缩模型恢复具有重要影响。

关键词

引用

@article{arxiv.2505.18166,
  title  = {Constrained Edge AI Deployment: Fine-Tuning vs Distillation for LLM Compression},
  author = {Jacob Sander and David Moe and Achraf Cohen and Brent Venable and Venkat Dasari and Brian Jalaian},
  journal= {arXiv preprint arXiv:2505.18166},
  year   = {2025}
}

备注

9 Pages, 2 Figures