中文

重新审视知识蒸馏中的中间层匹配:层选择策略(几乎)无关紧要

机器学习 2025-12-11 v2 人工智能 计算与语言

摘要

知识蒸馏(KD)是一种将知识从大型“教师”模型转移到小型“学生”模型的流行方法。先前的工作探索了知识蒸馏中中间层匹配的各种层选择策略(例如,前向匹配和顺序随机匹配),其中学生层被迫类似于某一教师层。在本研究中,我们重新审视了此类层选择策略,并观察到一个有趣的现象:在中间层匹配中,层选择策略(几乎)无关紧要——即使是看似无意义的匹配策略(如反向匹配)也能带来令人惊讶的良好学生性能。我们通过从学生视角考察教师层之间的角度,对这一现象进行了解释。我们的研究为知识蒸馏实践提供了启示,即层选择策略可能不是知识蒸馏系统设计的主要关注点,而普通的前向匹配在大多数设置下表现良好。

关键词

引用

@article{arxiv.2502.04499,
  title  = {Revisiting Intermediate-Layer Matching in Knowledge Distillation: Layer-Selection Strategy Doesn't Matter (Much)},
  author = {Zony Yu and Yuqiao Wen and Lili Mou},
  journal= {arXiv preprint arXiv:2502.04499},
  year   = {2025}
}

备注

Accepted at IJCNLP-AACL 2025