中文

In Good GRACEs:知识蒸馏的原则化教师选择

机器学习 2025-12-23 v3 计算与语言

摘要

知识蒸馏是一种高效利用大型“教师”语言模型生成的数据来训练小型能干“学生”模型的策略,但为特定的学生-任务组合选择最优教师需要昂贵的试错成本。我们提出一种轻量级评分指标 GRACE,用于量化某位教师对训练后学生模型的有效性。GRACE 测量学生梯度的分布属性,无需访问验证器、教师 logits、教师内部状态或测试数据。从信息论角度看,GRACE 与梯度基于算法的留一稳定性相连接,这控制了蒸馏后学生的泛化性能。在 GSM8K 和 MATH 上,GRACE 与蒸馏后 LLaMA 和 OLMo 学生的性能高度相关(最高达 86% 斯佩尔相关系数)。特别是,使用 GRACE 选择的教师训练的学生性能可比盲目使用最佳性能教师提升最高 7.4%。进一步,GRACE 可为关键蒸馏设计选择提供指导,包括:(1) 使用教师生成时的最佳温度;(2) 在大小约束条件下的最佳教师;(3) 特定模型家族中最佳教师。总体而言,我们的发现表明,GRACE 能够高效且有效地识别给定学生的最匹配教师,并提供在蒸馏过程中进行细粒度指导。

关键词

引用

@article{arxiv.2511.02833,
  title  = {In Good GRACEs: Principled Teacher Selection for Knowledge Distillation},
  author = {Abhishek Panigrahi and Bingbin Liu and Sadhika Malladi and Sham Kakade and Surbhi Goel},
  journal= {arXiv preprint arXiv:2511.02833},
  year   = {2025}
}