用于知识蒸馏的数据压缩扩展方法
机器学习
2025-11-11 v2 人工智能
摘要
压缩数据集提供了对大型数据集的紧凑表示,但直接在其上训练模型或使用它们来通过知识蒸馏(KD)增强模型性能可能导致次优结果,因为信息有限。为此,我们提出一种方法,通过模型反演扩展压缩数据集,这是一种基于预训练模型对其训练数据印象生成合成数据的技术。该方法特别适合KD场景,因为教师模型已经预训练并保留了原始训练数据的知识。通过创建补充压缩样本的合成数据,我们丰富了训练集,更好地近似 underlying 数据分布,导致在知识蒸馏期间学生模型准确率提高。我们的方法在各种数据集和模型架构上显示出显著提升,比仅使用压缩数据集高出最高可达11.4%,并在仅使用每个类别一个压缩样本的情况下仍然有效,还能在仅有有限真实数据样本的少样本场景中提高性能。
引用
@article{arxiv.2408.13850,
title = {Condensed Data Expansion Using Model Inversion for Knowledge Distillation},
author = {Kuluhan Binici and Shivam Aggarwal and Cihan Acar and Nam Trung Pham and Karianto Leman and Gim Hee Lee and Tulika Mitra},
journal= {arXiv preprint arXiv:2408.13850},
year = {2025}
}
备注
Accepted by the Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)