并非所有样本都应被等效利用:关于数据蒸馏的理解与改进
计算机视觉与模式识别
2025-06-10 v2 人工智能
摘要
数据蒸馏(Dataset Distillation, DD)旨在合成小数据集,使其在性能上相当于原始数据集。尽管众多DD方法取得了成功,但该领域的理论探索仍未得到关注。本文从样本难度的角度出发,初步理解各种基于匹配的DD方法。我们首先通过梯度范数测量样本难度,并观察到不同的基于匹配的方法大致对应特定的难度倾向。随后,我们将数据修剪的神经比例规律扩展到DD,以理论解释这些基于匹配的方法。我们的发现表明,优先合成原始数据集中更易的样本可以提高蒸馆数据集的质量,尤其在样本数目较少(image-per-class, IPC)的情况下。基于我们的经验观察和理论分析,我们引入了样本难度纠正(Sample Difficulty Correction, SDC)方法,旨在主要生成更易的样本以实现更高的数据集质量。我们的SDC可作为即插即用的插件,几乎无需额外代码调整即可集成到现有方法中。实验结果表明,添加SDC可在7种蒸馏方法和6个数据集上生成更高质量的蒸馆数据集。
引用
@article{arxiv.2408.12483,
title = {Not All Samples Should Be Utilized Equally: Towards Understanding and Improving Dataset Distillation},
author = {Shaobo Wang and Yantai Yang and Qilong Wang and Kaixin Li and Linfeng Zhang and Junchi Yan},
journal= {arXiv preprint arXiv:2408.12483},
year = {2025}
}
备注
Accepted by Synthetic Data for Computer Vision Workshop at CVPR, 2025