中文

阐明数据压缩设计空间

机器学习 2025-01-20 v4 人工智能 计算机视觉与模式识别

摘要

数据压缩是数据导向学习中的一个概念,能够高效地将原始数据集中的关键属性传输到保持多样性和真实感的合成版本中。该方法显著提高了模型训练效率,适用于多个应用领域。数据压缩以前的方法面临挑战:一些方法计算成本高,限制了对大型数据集的可扩展性(如 MTT、DREAM 和 TESLA),而另一些方法受限于较不优化的设计空间,可能阻碍潜在改进,尤其是在较小的数据集上(如 SRe2L、G-VBSM 和 RDED)。为解决这些限制,我们提出了一个综合的设计框架,包括特定、有效的策略,例如实施软类别感知匹配和调整学习率计划。这些策略都有实证证据和理论依据。我们的 resulting 方法,Elucidate Dataset Condensation (EDC),为小规模和大规模数据压缩建立了基准。在测试中,EDC 在 ImageNet-1k 上使用 ResNet-18 模型以 IPC=10 实现了 48.6% 的准确率,这对应于 0.78% 的压缩比率。该性能超过 SRe2L、G-VBSM 和 RDED 分别提升了 27.3%、17.2% 和 6.6%。

关键词

引用

@article{arxiv.2404.13733,
  title  = {Elucidating the Design Space of Dataset Condensation},
  author = {Shitong Shao and Zikai Zhou and Huanran Chen and Zhiqiang Shen},
  journal= {arXiv preprint arXiv:2404.13733},
  year   = {2025}
}

备注

Accepted by NeurIPS 2024