ShiftKD: 分布偏移下的知识蒸馏基准测试
机器学习
2025-07-22 v3
摘要
知识蒸馏(KD)将知识从大模型转移到小模型,最近取得了显著成功。然而,现有KD方法在实际应用中的可靠性,特别是在分布偏移下,仍未得到充分探索。分布偏移是指训练阶段和测试阶段之间的数据分布漂移,这可能会对KD的效果产生不利影响。在本文中,我们提出了一个统一且系统的框架\textsc{ShiftKD},用于针对两种常见的分布偏移(多样性和相关性偏移)对KD进行基准测试。该评估基准涵盖了来自算法、数据驱动和优化视角的30多种方法,涉及五个基准数据集。我们开发的\textsc{ShiftKD}进行了大量实验,揭示了当前最先进KD方法的优势和局限性。更重要的是,我们深入分析了学生模型训练过程中的关键因素,包括数据增强、剪枝方法、优化器和评估指标。我们相信\textsc{ShiftKD}可以作为评估KD在真实场景中有效性的基准,从而推动开发更鲁棒的KD方法以应对不断变化的需求。代码将在发表后提供。
引用
@article{arxiv.2312.16242,
title = {ShiftKD: Benchmarking Knowledge Distillation under Distribution Shift},
author = {Songming Zhang and Yuxiao Luo and Ziyu Lyu and Xiaofeng Chen},
journal= {arXiv preprint arXiv:2312.16242},
year = {2025}
}
备注
Code:https://github.com/ZZhangsm/OOKD