三元组知识蒸馏
计算机视觉与模式识别
2023-05-26 v1
摘要
在知识蒸馏中,教师模型通常远大于学生模型,使得教师的解往往难以被学生学习。为缓解模仿难度,我们引入了一种称为 TriKD 的三元组知识蒸馏机制。除教师和学生外,TriKD 引入第三个角色,称为锚模型。在蒸馏开始前,预训练的锚模型在目标问题的完整解空间内划定一个子空间。该子空间内的解预期为学生能够良好模仿的简易目标。随后以在线方式进行蒸馏,且教师仅被允许表达上述子空间内的解。令人惊讶的是,受益于准确但易于模仿的提示,学生最终能表现良好。在学生训练充分后,其可作为新学生的新锚模型,形成课程学习策略。我们在图像分类与人脸识别上基于多种模型的实验清晰证明了方法的有效性。此外,所提出的 TriKD 在处理过拟合问题上同样有效。而且,我们的理论分析支撑了三元组蒸馏的合理性。
引用
@article{arxiv.2305.15975,
title = {Triplet Knowledge Distillation},
author = {Xijun Wang and Dongyang Liu and Meina Kan and Chunrui Han and Zhongqin Wu and Shiguang Shan},
journal= {arXiv preprint arXiv:2305.15975},
year = {2023}
}