中文

通过模型增强加速数据集蒸馏

机器学习 2023-04-18 v2 人工智能

摘要

数据集蒸馏(Dataset Distillation, DD)是一个新兴领域,旨在从大型数据集中生成小得多但高效的合成训练数据集。现有的基于梯度匹配的数据集蒸馏方法取得了领先性能;然而,它们计算开销极大,因为需要在数千个随机初始化的模型中持续优化一个数据集。在本文中,我们假设使用多样化模型训练合成数据可带来更好的泛化性能。因此我们提出了两种模型增强技术,即使用早期阶段模型与参数扰动,以显著降低了训练成本的方式学习一个信息丰富的合成集。大量实验表明,我们的方法实现了高达20倍的加速,并取得了与最先进(state-of-the-art)方法相当的性能。

关键词

引用

@article{arxiv.2212.06152,
  title  = {Accelerating Dataset Distillation via Model Augmentation},
  author = {Lei Zhang and Jie Zhang and Bowen Lei and Subhabrata Mukherjee and Xiang Pan and Bo Zhao and Caiwen Ding and Yao Li and Dongkuan Xu},
  journal= {arXiv preprint arXiv:2212.06152},
  year   = {2023}
}