从 in-context 样本检索视角重新思考蒸馏中的知识
计算机视觉与模式识别
2025-01-14 v1
摘要
传统知识蒸馏 (KD) 方法旨在让学生模型对每个样本的预测输出与教师模型相似。然而,同一类别样本之间的关系往往被忽视。在本文中,我们探索如何重新定义蒸馏中的知识,捕捉每个样本与其对应 in-context 样本(一组具有相同或不同类别的相似样本)之间的关系,并从 in-context 样本检索视角进行 KD。由于 KD 是一种学习的标签平滑正则化 (LSR),我们首先进行理论分析,表明教师来自 in-context 样本的知识是正规化学生训练的关键贡献者。基于分析,我们提出一种 novel in-context 知识蒸馏 (IC-KD) 框架,在各种 KD 范式 (离线、在线和教师-free KD) 中均显示优势。首先,我们从教师模型中构建特征存储库,并通过检索学习为每个样本检索 in-context 样本。随后,我们引入 Positive In-Context Distillation (PICD) 以减少来自学生的样本与来自教师的同一类别 in-context 样本在逻辑空间中的差异。此外,引入 Negative In-Context Distillation (NICD) 以分离来自学生的样本与来自教师的不同类别 in-context 样本在逻辑空间中的距离。大量实验表明,IC-KD 在各种类型的 KD 中都有效,并且在 CIFAR-100 和 ImageNet 数据集上持续实现最先进的性能。
关键词
引用
@article{arxiv.2501.07040,
title = {Rethinking Knowledge in Distillation: An In-context Sample Retrieval Perspective},
author = {Jinjing Zhu and Songze Li and Lin Wang},
journal= {arXiv preprint arXiv:2501.07040},
year = {2025}
}