大语言模型的知识蒸馏与数据蒸馏:新兴趋势、挑战与未来方向
计算与语言
2026-01-06 v2 机器学习
机器学习
摘要
大语言模型(LLMs)的指数级增长持续凸显了满足日益扩张的计算和数据需求的高效策略的必要性。本综述提供了对两种互补范式的全面分析:知识蒸馏(KD)和数据蒸馏(DD),两者旨在压缩 LLMs 同时保持其先进的推理能力和语言多样性。我们首先检视 KD 中的关键方法,如任务特定对齐、基于论证的训练和多教师框架,以及通过优化基于梯度匹配、潜在空间正则化和生成合成等技术实现数据蒸馏的 DD 技术。建立在这些基础之上,我们探讨了将 KD 与 DD 集成可产生更有效和可扩展压缩策略的方法。总体而言,这些方法解决了模型可扩展性、架构异构性以及保持 LLM 新兴能力的持久挑战。我们进一步指出了跨领域应用,如医疗保健和教育领域,蒸馏可实现在不牺牲性能的前提下高效部署。尽管取得了显著进展,但在保留新兴推理和语言多样性、支持不断演变的教师模型和数据集的高效适应,以及建立全面的评估协议方面仍存在开放性挑战。通过综合方法学创新、理论基础和实践见解,我们的综述勾勒了通过更紧密集成 KD 和 DD 原则实现可持续、资源高效 LLMs 的道路。
引用
@article{arxiv.2504.14772,
title = {Knowledge Distillation and Dataset Distillation of Large Language Models: Emerging Trends, Challenges, and Future Directions},
author = {Luyang Fang and Xiaowei Yu and Jiazhang Cai and Yongkai Chen and Shushan Wu and Zhengliang Liu and Zhenyuan Yang and Haoran Lu and Xilin Gong and Yufang Liu and Terry Ma and Wei Ruan and Ali Abbasi and Jing Zhang and Tao Wang and Ehsan Latif and Weihang You and Hanqi Jiang and Wei Liu and Wei Zhang and Soheil Kolouri and Xiaoming Zhai and Dajiang Zhu and Wenxuan Zhong and Tianming Liu and Ping Ma},
journal= {arXiv preprint arXiv:2504.14772},
year = {2026}
}