中文

通过知识蒸馏揭示小型语言模型后训练的强大能力

计算机视觉与模式识别 2025-10-01 v1

摘要

大型语言模型(LLM)的快速发展显著推动了人工智能在多个领域的能力提升。然而,这些模型的庞大规模和高计算成本使其不适用于资源受限的边缘环境,这就造成了对能够在边缘高效运行的高性能小模型的迫切需求。然而,这些较小的模型在仅经过预训练后,往往难以满足复杂任务的性能要求。为弥合这一差距,我们引入了一套系统化的后训练流程,高效提升小型模型的准确性。我们的后训练流程包括基于课程的监督微调(SFT)和离线联合知识蒸馏。得到的指令调优模型在百亿参数模型中实现了最先进的性能,展现出在严格硬件约束下强大的泛化能力,同时在多种任务中保持竞争的准确性。这一工作为在Ascend边缘设备上开发高性能语言模型提供了实用且高效的解决方案。

关键词

引用

@article{arxiv.2509.26497,
  title  = {Revealing the Power of Post-Training for Small Language Models via Knowledge Distillation},
  author = {Miao Rang and Zhenni Bi and Hang Zhou and Hanting Chen and An Xiao and Tianyu Guo and Kai Han and Xinghao Chen and Yunhe Wang},
  journal= {arXiv preprint arXiv:2509.26497},
  year   = {2025}
}

备注

7