中文

基于 Concrete Score Matching 的大语言模型蒸馏

机器学习 2026-03-03 v2 人工智能

摘要

大语言模型(LLM)性能卓越但部署成本高昂,促使人们通过知识蒸馏(KD)实现高效推理。现有的 KD 目标通常通过 softmax 匹配学生模型和教师模型的概率,这会模糊有价值的 logit 信息。虽然直接 logit 蒸馏(DLD)缓解了 softmax 的平滑效应,但它未考虑 logit 平移不变性,从而限制了求解空间。我们提出了 Concrete Score Distillation(CSD),这是一种离散分数匹配目标,克服了 softmax 引起的平滑效应以及对最优解集的限制。我们解决了自回归 LLM 中离散分数匹配的训练不稳定性和二次复杂度问题,所得的 CSD 目标通过灵活的加权,使所有词表对中学生和教师模型之间的相对 logit 差异保持一致。我们在框架内提供了 mode-seeking 和 mode-covering 的实例,并使用 GPT-2-1.5B、OpenLLaMA-7B 和 GEMMA-7B-IT 在任务无关的指令遵循和特定任务蒸馏上评估了 CSD。实验表明,CSD 持续超越近期的 KD 目标,实现了良好的保真度-多样性权衡,并在与 on-policy 技术结合时产生了互补增益,证明了其对 LLM 蒸馏的可扩展性和有效性。代码:https://github.com/aailab-kaist/CSD。

关键词

引用

@article{arxiv.2509.25837,
  title  = {Distillation of Large Language Models via Concrete Score Matching},
  author = {Yeongmin Kim and Donghyeok Shin and Mina Kang and Byeonghu Na and Il-Chul Moon},
  journal= {arXiv preprint arXiv:2509.25837},
  year   = {2026}
}

备注

ICLR 2026