LoCa:用于知识蒸馏的 Logit 校准
计算与语言
2024-09-10 v1 机器学习
摘要
知识蒸馏(KD)旨在通过模仿教师模型来训练更好的学生模型,在模型压缩中发挥重要作用。典型做法是对输出 logits 进行对齐。然而,我们发现存在一种名为误指令(mis-instruction)的常见问题,即基于教师 logits 的预测若不遵循标签,学生模型会被误导。同时,logits 中还包含其他有用的暗知识,如类判别性,这对蒸馏至关重要。本文提出一种简单而有效的 Logit 校准(LoCa)方法,基于真实标签对教师模型的 logits 进行校准。关键思想是在纠正预测(以解决误指令问题)的同时保持有用暗知识。我们提出的 LoCa 不需要任何额外参数。在图像分类和文本生成任务上的实验结果表明,LoCa 能有效提升基线模型的性能。
引用
@article{arxiv.2409.04778,
title = {LoCa: Logit Calibration for Knowledge Distillation},
author = {Runming Yang and Taiqiang Wu and Yujiu Yang},
journal= {arXiv preprint arXiv:2409.04778},
year = {2024}
}
备注
Accepted by ECAI 2024