中文

基于频域的数据集蒸馏

机器学习 2023-11-16 v1 人工智能 计算机视觉与模式识别

摘要

本文提出 FreD,一种新颖的数据集蒸馏参数化方法,其利用频域从大规模原始数据集中蒸馏出小尺寸合成数据集。与关注空间域的传统方法不同,FreD 采用基于频率的变换来优化每个数据实例的频域表示。通过利用空间域信息在特定频率分量上的集中性,FreD 智能地选择一部分频率维度进行优化,从而显著减少合成一个实例所需的预算。通过基于解释方差的频率维度选择,FreD 从理论和经验上证明了其能够在有限预算下高效运行,同时相比传统参数化方法更好地保留原始数据集的信息。此外,基于 FreD 与现有方法的正交兼容性,我们确认 FreD 在不同基准数据集的评估场景下持续提升现有蒸馏方法的性能。我们在 https://github.com/sdh0818/FreD 发布了代码。

关键词

引用

@article{arxiv.2311.08819,
  title  = {Frequency Domain-based Dataset Distillation},
  author = {Donghyeok Shin and Seungjae Shin and Il-Chul Moon},
  journal= {arXiv preprint arXiv:2311.08819},
  year   = {2023}
}

备注

Accepted at NeurIPS 2023