DistilQwen2.5: 训练提炼开源轻量语言模型的工业实践
计算与语言
2025-04-22 v1
摘要
增强大型语言模型(LLM)的计算效率并降低部署成本,已成为众多资源受限场景中的关键挑战。本文介绍 DistilQwen2.5,一系列从公开的 Qwen2.5 模型中提炼得到的轻量级 LLM。这些提炼模型基于一系列提炼技术,能够从更大规模的 LLM 中吸收知识,显示出比原始模型更强的指令跟随能力。在我们的工业实践中,我们首先利用容量各异的强大专有 LLM 作为多智能体教师,选择、重写和细化更适合学生 LLM 学习的指令-响应对。完成标准微调后,我们进一步采用一种计算高效的模型融合方法,使学生模型能够逐步整合来自教师模型的细粒度隐藏知识。实验评估表明,提炼模型比原始检查点具有显著更强的能力。此外,我们展示了实际应用场景,以说明本框架在现实世界中的应用。为便于实际使用,我们已将所有 DistilQwen2.5 模型发布给开源社区。
引用
@article{arxiv.2504.15027,
title = {DistilQwen2.5: Industrial Practices of Training Distilled Open Lightweight Language Models},
author = {Chengyu Wang and Junbing Yan and Yuanhao Yue and Jun Huang},
journal= {arXiv preprint arXiv:2504.15027},
year = {2025}
}