NAYER:用于高效有效无数据知识蒸馏的噪声层数据生成
计算机视觉与模式识别
2024-03-25 v2
摘要
无数据知识蒸馏(DFKD)近期取得显著进展,其无需访问原始数据即可将知识从教师神经网络迁移至学生神经网络。然而,现有方法在从随机噪声输入生成样本时面临重大挑战,此类输入天然缺乏有意义信息。因此,这些模型难以将噪声有效映射至真实样本分布,导致训练时间延长且输出质量低下。本文提出一种新颖的噪声层生成方法(NAYER),将随机源从输入重定位至噪声层,并利用有意义的常量标签-文本嵌入(LTE)作为输入。LTE 通过语言模型一次性生成,随后存储于内存供所有后续训练过程使用。LTE 的重要性在于其能包含大量有意义的类间信息,仅需少量训练步即可生成高质量样本。同时,噪声层通过防止模型过度强调受限标签信息,在解决样本生成多样性问题上发挥关键作用。通过在每次迭代中重新初始化噪声层,我们旨在促进多样样本生成,同时凭借 LTE 提供的易学习性保持方法效率。在多个数据集上的实验表明,我们的 NAYER 不仅优于最先进方法,而且速度较先前方法快 5 至 15 倍。代码见 https://github.com/tmtuan1307/nayer。
引用
@article{arxiv.2310.00258,
title = {NAYER: Noisy Layer Data Generation for Efficient and Effective Data-free Knowledge Distillation},
author = {Minh-Tuan Tran and Trung Le and Xuan-May Le and Mehrtash Harandi and Quan Hung Tran and Dinh Phung},
journal= {arXiv preprint arXiv:2310.00258},
year = {2024}
}
备注
Accepted at CVPR 2024