中文

用于高IPC数据集蒸馏的课程粗到细选择

计算机视觉与模式识别 2025-03-25 v1

摘要

数据集蒸馏 (Dataset Distillation, DD) 在合成每类少量图像时表现优异,但在高IPC设置下难以维持有效性。最近的工作表明,结合蒸馏数据和真实数据可缓解有效性衰减问题。然而,我们对该组合范式进行分析后发现,当前的单次选择和独立选择机制导致蒸馏图像与真实图像之间存在不兼容问题。为解决此问题,我们提出一种用于高IPC数据集蒸馏的新型课程粗到细选择 (Curriculum Coarse-to-Fine Selection, CCFS) 方法。CCFS采用课程选择框架进行真实数据选择,基于当前合成数据集的每个课程,使用粗到细策略选择合适的真实数据。广泛的实验验证了CCFS的有效性,在高IPC设置下在CIFAR-10上超越最新方法+6.6%,在CIFAR-100上+5.8%,在Tiny-ImageNet上+3.4%。值得注意的是,在20%压缩比例的Tiny-ImageNet上,CCFS实现了60.2%的测试准确率,仅比全数据集训练差0.3%。代码: https://github.com/CYDaaa30/CCFS。

关键词

引用

@article{arxiv.2503.18872,
  title  = {Curriculum Coarse-to-Fine Selection for High-IPC Dataset Distillation},
  author = {Yanda Chen and Gongwei Chen and Miao Zhang and Weili Guan and Liqiang Nie},
  journal= {arXiv preprint arXiv:2503.18872},
  year   = {2025}
}

备注

Accepted by CVPR2025