中文

论蒸馏数据集的多样性与真实性:一种高效的数据集蒸馏范式

计算机视觉与模式识别 2024-03-20 v2 人工智能 机器学习

摘要

当代机器学习需要在海量数据集上训练大型神经网络,因此面临着高计算需求的挑战。数据集蒸馏作为一种新兴策略,旨在压缩真实世界数据集以实现高效训练。然而,这一研究方向目前在处理大规模和高分辨率数据集时面临困难,阻碍了其实用性和可行性。为此,我们重新审视了现有的数据集蒸馏方法,并确定了大规模真实世界应用所需的三个属性,即真实性、多样性和效率。作为解决方案,我们提出了 RDED,一种新颖的计算高效且有效的数据蒸馏范式,以实现蒸馏数据的多样性和真实性。在各种神经架构和数据集上的大量实证结果证明了 RDED 的先进性:我们可以在 7 分钟内将完整的 ImageNet-1K 蒸馏为一个每类包含 10 张图像的小数据集,在单块 RTX-4090 GPU 上使用 ResNet-18 达到 42% 的显著 top-1 准确率(而 SOTA 仅达到 21% 但需要 6 小时)。

关键词

引用

@article{arxiv.2312.03526,
  title  = {On the Diversity and Realism of Distilled Dataset: An Efficient Dataset Distillation Paradigm},
  author = {Peng Sun and Bei Shi and Daiwei Yu and Tao Lin},
  journal= {arXiv preprint arXiv:2312.03526},
  year   = {2024}
}

备注

17 pages, 20 figures