生成分布蒸馏
机器学习
2025-07-22 v1 计算机视觉与模式识别
摘要
本文将知识蒸馏(KD)形式化为条件生成问题,提出“生成分布蒸馏”(GenDD)框架。经典 GenDD 框架面临两个主要挑战:高维优化的诅咒以及标签缺乏语义监督。为此,我们引入“分片标记”策略,实现稳定有效的无监督 KD;同时开发“分布收缩”技术,将标签监督整合到重构目标中。我们的理论证明表明,具备“分布收缩”的 GenDD 可作为多任务学习的梯度级替代品,在无需在多步采样图像表示上显式分类损失的情况下,实现高效的监督训练。为评估方法有效性,我们在平衡、不平衡及无标签数据上进行实验。实验结果显示,GenDD 在无监督设置下表现竞争,显著优于 KL 基线方法,在 ImageNet 验证集上提升 16.29%。在有标签监督情况下,我们的 ResNet-50 在 ImageNet 上以 600 个 epoch 训练达到 82.28% 的 Top-1 准确率,建立了新的 SOTA。
引用
@article{arxiv.2507.14503,
title = {Generative Distribution Distillation},
author = {Jiequan Cui and Beier Zhu and Qingshan Xu and Xiaogang Xu and Pengguang Chen and Xiaojuan Qi and Bei Yu and Hanwang Zhang and Richang Hong},
journal= {arXiv preprint arXiv:2507.14503},
year = {2025}
}
备注
Technique report