通过模型增强加速数据集蒸馏
机器学习
2023-04-18 v2 人工智能
摘要
数据集蒸馏(Dataset Distillation, DD)是一个新兴领域,旨在从大型数据集中生成小得多但高效的合成训练数据集。现有的基于梯度匹配的数据集蒸馏方法取得了领先性能;然而,它们计算开销极大,因为需要在数千个随机初始化的模型中持续优化一个数据集。在本文中,我们假设使用多样化模型训练合成数据可带来更好的泛化性能。因此我们提出了两种模型增强技术,即使用早期阶段模型与参数扰动,以显著降低了训练成本的方式学习一个信息丰富的合成集。大量实验表明,我们的方法实现了高达20倍的加速,并取得了与最先进(state-of-the-art)方法相当的性能。
引用
@article{arxiv.2212.06152,
title = {Accelerating Dataset Distillation via Model Augmentation},
author = {Lei Zhang and Jie Zhang and Bowen Lei and Subhabrata Mukherjee and Xiang Pan and Bo Zhao and Caiwen Ding and Yao Li and Dongkuan Xu},
journal= {arXiv preprint arXiv:2212.06152},
year = {2023}
}