扩散模型作为数据蒸馏先验
机器学习
2026-04-06 v2
摘要
数据蒸馏旨在从大型数据集合成紧凑且信息丰富的数据集。在该领域中,实现单个蒸馏数据集中多样性、泛化性和代表性的三重目标是一个重大挑战。虽然最近的生成式数据蒸馏方法采用强大的扩散模型作为基础模型,但这些方法常常忽视了扩散模型中固有的代表性先验。因此,这些方法通常需要集成外部约束来提高数据质量。为此,我们提出了扩散作为先验(DAP)方法,通过对抓取器核在特征空间中衡量合成数据与真实数据之间的相似性来形式化代表性。随后,我们将该先验作为指导引入,以引导逆扩散过程,提高蒸馏样本的代表性,而无需任何重新训练。在ImageNet-1K及其子集等大规模数据集上的大量实验表明,DAP在生成高保真数据集方面超过了最先进的方法,同时实现了卓越的跨架构泛化。我们的工作不仅在扩散先验与数据蒸馏目标之间建立了理论联系,也提供了一种实用的、无需训练的框架,用于提高蒸馏数据集的质量。
引用
@article{arxiv.2510.17421,
title = {Diffusion Models as Dataset Distillation Priors},
author = {Duo Su and Huyu Wu and Huanran Chen and Yiming Shi and Yuzhu Wang and Xi Ye and Jun Zhu},
journal= {arXiv preprint arXiv:2510.17421},
year = {2026}
}