一致信息软标签温度用于知识蒸馏
机器学习
2026-05-21 v1 人工智能
摘要
知识蒸馏(Knowledge Distillation, KD)通过匹配预测分布将知识从高容量教师模型转移到紧凑学生模型,温度缩放作为核心机制用于平滑教师预测并暴露硬标签之外的有价值“暗知识”。然而,标准的固定温度设计本质上是样本不可感知的。由于样本在逻辑尺度和学习难度上存在差异,单一全局温度会导致教师软标签的熵值高度不一致:部分预测过于尖锐,提供有限的类别间信息;而另一些预测则过度平滑,丢失类别判别性信息。此外,教师与学生共享相同温度进一步强制实现刚性的逻辑尺度对齐,尽管两者的容量存在差异。为此,我们提出CIST(Consistently Informative Soft-label Temperature),为教师和学生分别分配样本级自适应温度。该设计产生一致信息的教师软标签,同时放宽教师-学生逻辑尺度匹配的刚性约束。它还根据教师置信度和学生学习难度对蒸馏目标进行重新加权。理论上,我们证明教师标签熵主要由教师最大逻辑值与温度之比决定,为自适应平滑提供原则依据。实验上,CIST缓解了固定温度引起的不一致性,在视觉和语言蒸馈任务中均相对于标准KD和强基线实现了持续的改进,同时几乎没有计算开销。
引用
@article{arxiv.2605.20357,
title = {Consistently Informative Soft-Label Temperature for Knowledge Distillation},
author = {Hoang-Chau Luong and Nghia Van Vo and Kaiqi Zhao and Lingwei Chen},
journal= {arXiv preprint arXiv:2605.20357},
year = {2026}
}