重新思考大规模数据集压缩:从标签转向图像
计算机视觉与模式识别
2025-02-11 v1 机器学习
摘要
数据提炼和数据剪枝是两种用于提高计算和存储效率以压缩数据集的突出技术。尽管它们的目标相互重叠,这些方法很少直接进行比较。即使在每个领域内部,各种方法之间的评估协议也不一致,这 complicates 公平比较并阻碍了可重复性。鉴于这些限制,本文提出了一个在数据提炼和剪枝文献中公平评估方法的基准。值得注意的是,我们的基准揭示了在大规模数据集上进行数据提炼的主流设置中(该设置严重依赖来自预训练模型的软标签),即使是随机选取的子集也能实现惊人的竞争性能。这一发现表明,过度关注软标签可能转移了对图像数据内在价值的注意力,同时还会增加生成、存储和应用的额外负担。为了解决这些问题,我们提出了一种新型数据压缩框架,称为 Prune、Combine、Augment(PCA),该框架专注于仅利用图像数据,仅使用硬标签进行评估,并在此设置下实现最先进的性能。通过将注意力重新转向图像,我们的基准和 PCA 框架为数据压缩研究的更平衡和可及的方法铺平了道路。我们的代码可在:https://github.com/ArmandXiao/Rethinking-Dataset-Compression 获取。
引用
@article{arxiv.2502.06434,
title = {Rethinking Large-scale Dataset Compression: Shifting Focus From Labels to Images},
author = {Lingao Xiao and Songhua Liu and Yang He and Xinchao Wang},
journal= {arXiv preprint arXiv:2502.06434},
year = {2025}
}
备注
Work In Progress