将数据集蒸馏至不足一张图像
计算机视觉与模式识别
2024-03-19 v1
摘要
数据集蒸馏旨在将数据集压缩成一个更小的数据集,使得在蒸馏数据集上训练的模型能获得高准确率。当前方法将此构建为在每类K张蒸馏图像的预算下最大化蒸馏分类准确率,其中K为正整数。在本文中,我们突破了数据集蒸馏的边界,将数据集压缩至每类不足一张图像。重要的是要认识到,有意义的量不是每类蒸馏图像的数量,而是每个数据集蒸馏像素的数量。因此,我们提出了海报数据集蒸馏,一种将整个原始数据集蒸馏成单张海报的新方法。海报方法激发了用于创建训练图像和可学习标签的新技术方案。与使用每类一张图像的现有方法相比,我们的方法在每类不足一张图像的情况下实现了相当或更好的性能。具体而言,我们的方法在CIFAR-10、CIFAR-100和CUB200上仅使用低至每类0.3张图像便确立了新的SOTA性能。
引用
@article{arxiv.2403.12040,
title = {Distilling Datasets Into Less Than One Image},
author = {Asaf Shul and Eliahu Horwitz and Yedid Hoshen},
journal= {arXiv preprint arXiv:2403.12040},
year = {2024}
}