基于频域的数据集蒸馏
机器学习
2023-11-16 v1 人工智能
计算机视觉与模式识别
摘要
本文提出 FreD,一种新颖的数据集蒸馏参数化方法,其利用频域从大规模原始数据集中蒸馏出小尺寸合成数据集。与关注空间域的传统方法不同,FreD 采用基于频率的变换来优化每个数据实例的频域表示。通过利用空间域信息在特定频率分量上的集中性,FreD 智能地选择一部分频率维度进行优化,从而显著减少合成一个实例所需的预算。通过基于解释方差的频率维度选择,FreD 从理论和经验上证明了其能够在有限预算下高效运行,同时相比传统参数化方法更好地保留原始数据集的信息。此外,基于 FreD 与现有方法的正交兼容性,我们确认 FreD 在不同基准数据集的评估场景下持续提升现有蒸馏方法的性能。我们在 https://github.com/sdh0818/FreD 发布了代码。
引用
@article{arxiv.2311.08819,
title = {Frequency Domain-based Dataset Distillation},
author = {Donghyeok Shin and Seungjae Shin and Il-Chul Moon},
journal= {arXiv preprint arXiv:2311.08819},
year = {2023}
}
备注
Accepted at NeurIPS 2023