关系表示蒸馏
计算机视觉与模式识别
2025-05-14 v5 人工智能
摘要
知识蒸馈涉及将来自大型笨重教师模型的知识转移到更紧凑的学生模型。标准方法通过最小化教师和学生网络概率输出之间的 KL 散度来实现。然而,这种方法未能捕捉教师内部表示中重要的结构关系。最近的对比学习目标方法试图解决这一问题,但这些方法通过实例判别施加过于严格的约束,迫使相似样本之间保持距离,即使它们本应该保持相似性。这促使我们提出另一种目标函数,通过保持实例之间的相对关系来实现。本方法为教师和学生分布分别采用不同的温度参数,其中学生输出更尖锐,从而实现对主要关系的精确学习,同时保持次要相似性。我们展示了我们的目标函数与 InfoNCE 损失和 KL 散度之间的理论联系。实验表明,我们的方法在多样化的知识转移任务中显著优于现有知识蒸馈方法,实现更好的与教师模型对齐,有时甚至超过教师网络。
关键词
引用
@article{arxiv.2407.12073,
title = {Relational Representation Distillation},
author = {Nikolaos Giakoumoglou and Tania Stathaki},
journal= {arXiv preprint arXiv:2407.12073},
year = {2025}
}
备注
Preprint. Code: https://github.com/giakoumoglou/distillers, Supplementary: https://giakoumoglou.com/src/rrd_suppl.pdf