Heavy Labels Out! 基于标签减轻的数据集提炼
计算机视觉与模式识别
2024-08-16 v1
摘要
数据集提炼或浓缩旨在将大规模训练数据集压缩成更小的合成数据集,使得在神经网络上,浓缩后数据集和原始数据集的训练性能相似。虽然可以大幅减少训练样本数量,但当前的 SOTA 方法高度依赖巨大的软标签才能实现令人满意的性能。结果是,尤其是对于大规模数据集,所需存储量甚至可与原始数据集相当。为解决此问题,我们提出一种新颖的标签减轻框架,称为 HeLlO,旨在构建有效的图像到标签 投影器,以便可直接从合成图像在线生成合成标签。具体而言,为构建此类投影器,我们利用开源基础模型中的先验知识(如 CLIP),并引入类似 LoRA 的微调策略来缓解预训练模型与目标分布之间的差距,以便将用于软标签生成的原始模型浓缩为一组低秩矩阵。此外,提出一种有效的图像优化方法,以进一步减轻原始和浓缩标签生成器之间潜在误差。广泛的实验表明,仅需约相当于完整软标签存储量的 0.003%,即可在大规模数据集上实现与当前 SOTA 数据集提炼方法相当的性能。我们的代码将公开提供。
引用
@article{arxiv.2408.08201,
title = {Heavy Labels Out! Dataset Distillation with Label Space Lightening},
author = {Ruonan Yu and Songhua Liu and Zigeng Chen and Jingwen Ye and Xinchao Wang},
journal= {arXiv preprint arXiv:2408.08201},
year = {2024}
}