面向知识蒸馏的动态温度调度器
机器学习
2025-11-19 v1 人工智能
摘要
知识蒸馏(KD)通过大型预训练教师模型训练较小的学生模型,温度作为关键超参数控制输出概率的软硬程度。传统方法在训练期间固定温度,往往次优。此外,教师与学生之间的架构差异常导致logit幅度不匹配。我们证明学生模型在训练早期受益于更软的概率,而在后期需要更尖锐的概率。我们引入动态温度调度器(DTS),其根据教师与学生之间的交叉熵损失差动态调整温度。据我们了解,这是首个基于教师与学生分布间差异自适应温度的调度方法。该方法可无缝集成到现有KD框架中。我们在视觉(CIFAR-100、Tiny-ImageNet)和NLP任务(GLUE、Dolly、SelfIns、UnNI、S-NI)上验证了DTS,始终优于固定温度基准。代码已公开:https://github.com/Sibgat-Ul/DTS。
引用
@article{arxiv.2511.13767,
title = {Dynamic Temperature Scheduler for Knowledge Distillation},
author = {Sibgat Ul Islam and Jawad Ibn Ahad and Fuad Rahman and Mohammad Ruhul Amin and Nabeel Mohammed and Shafin Rahman},
journal= {arXiv preprint arXiv:2511.13767},
year = {2025}
}