中文

大数据时代下通过课程数据合成的数据集蒸馏

计算机视觉与模式识别 2024-11-26 v2 人工智能 机器学习

摘要

数据集蒸馏或压缩旨在从大型数据集中生成更小但具代表性的子集,使模型能够更高效训练,同时在原始测试数据分布上评估以取得良好性能。先前的解耦方法如 SRe2^2L 简单地使用统一梯度更新方案从高斯噪声合成数据,而我们注意到最初的若干更新迭代将决定合成的最终轮廓,因此不当的梯度更新策略可能剧烈影响最终生成质量。为此,我们在数据合成期间引入由课程数据增强(CDA\texttt{CDA})实现的简单而有效的全局到局部梯度精炼方法。所提框架在大规模 ImageNet-1K 与 21K 上以 IPC(每类图像数)50 下 63.2% 与 IPC 20 下 36.1% 取得当前已发布的最高准确率,使用常规输入分辨率 224×\times224,具有更快收敛速度与更少合成时间。所提模型在 ImageNet-1K/21K 上以超过 4% 的 Top-1 准确率优于当前最先进方法如 SRe2^2L、TESLA 与 MTT,并首次将其与全数据训练对应模型的差距缩小至绝对 15% 以内。此外,本工作是标准 224×\times224 分辨率下在更大规模 ImageNet-21K 数据集上数据集蒸馏的首次成功。我们的代码与蒸馏的 20 IPC、2K 恢复预算的 ImageNet-21K 数据集发布于 https://github.com/VILA-Lab/SRe2L/tree/main/CDA。

关键词

引用

@article{arxiv.2311.18838,
  title  = {Dataset Distillation via Curriculum Data Synthesis in Large Data Era},
  author = {Zeyuan Yin and Zhiqiang Shen},
  journal= {arXiv preprint arXiv:2311.18838},
  year   = {2024}
}

备注

TMLR 2024 Camera-ready Version. Code and distilled ImageNet-21K dataset are available at https://github.com/VILA-Lab/SRe2L/tree/main/CDA