论蒸馏数据集的多样性与真实性:一种高效的数据集蒸馏范式
计算机视觉与模式识别
2024-03-20 v2 人工智能
机器学习
摘要
当代机器学习需要在海量数据集上训练大型神经网络,因此面临着高计算需求的挑战。数据集蒸馏作为一种新兴策略,旨在压缩真实世界数据集以实现高效训练。然而,这一研究方向目前在处理大规模和高分辨率数据集时面临困难,阻碍了其实用性和可行性。为此,我们重新审视了现有的数据集蒸馏方法,并确定了大规模真实世界应用所需的三个属性,即真实性、多样性和效率。作为解决方案,我们提出了 RDED,一种新颖的计算高效且有效的数据蒸馏范式,以实现蒸馏数据的多样性和真实性。在各种神经架构和数据集上的大量实证结果证明了 RDED 的先进性:我们可以在 7 分钟内将完整的 ImageNet-1K 蒸馏为一个每类包含 10 张图像的小数据集,在单块 RTX-4090 GPU 上使用 ResNet-18 达到 42% 的显著 top-1 准确率(而 SOTA 仅达到 21% 但需要 6 小时)。
引用
@article{arxiv.2312.03526,
title = {On the Diversity and Realism of Distilled Dataset: An Efficient Dataset Distillation Paradigm},
author = {Peng Sun and Bei Shi and Daiwei Yu and Tao Lin},
journal= {arXiv preprint arXiv:2312.03526},
year = {2024}
}
备注
17 pages, 20 figures