什么构成了适合知识蒸馏的良好数据集?
计算机视觉与模式识别
2025-10-03 v2
摘要
知识蒸馏(KD)一直是一种流行且有效的模型压缩方法。KD 的一个重要假设是,在训练学生模型时,教师模型的原始数据集也将是可用的。然而,在持续学习以及对在公司保密数据集上训练的大型模型进行蒸馏等情况下,访问原始数据并不总是可行的。这促使从业者利用其他来源的补充数据,但可能产生参差不齐的结果。于是人们必须问:“什么构成了适合将知识从教师模型迁移给学生模型的良好数据集?”许多人会假设只有真实的域内图像是可行的,但这是唯一的选择吗?在这项工作中,我们探索了多种可能的替代蒸馏数据集,并证明许多不同的数据集,甚至是不自然的合成图像,都可以作为 KD 中合适的替代品。通过检查这些替代数据集,我们识别并提出了描述什么构成适合蒸馏的良好数据集的各种标准。源代码可在 https://github.com/osu-cvl/good-kd-dataset 获取。
引用
@article{arxiv.2411.12817,
title = {What Makes a Good Dataset for Knowledge Distillation?},
author = {Logan Frank and Jim Davis},
journal= {arXiv preprint arXiv:2411.12817},
year = {2025}
}