中文

利用数据集蒸馏中的样本间与特征间关系

计算机视觉与模式识别 2024-04-02 v1

摘要

数据集蒸馏已成为深度学习中一种极具前景的方法,能够利用从较大规模真实数据集导出的小型合成数据集进行高效训练。特别是,基于分布匹配的蒸馏方法因其有效性和低计算成本而备受关注。然而,这些方法面临两个主要局限:合成数据集中同一类别内特征分布分散,降低了类别判别能力;以及仅关注平均特征一致性,缺乏精确性和全面性。为了应对这些挑战,我们引入了两种新的约束:类别集中约束和协方差匹配约束。类别集中约束旨在通过更紧密地聚集类内样本来增强类别判别能力。协方差匹配约束寻求通过局部特征协方差矩阵在真实数据集和合成数据集之间实现更准确的特征分布匹配,这在样本数量远小于特征数量时尤为有益。实验表明,引入这些约束带来了显著改善,与最先进的相关方法相比,在 CIFAR10 上性能提升了 6.6%,在 SVHN 上提升了 2.9%,在 CIFAR100 上提升了 2.5%,在 TinyImageNet 上提升了 2.5%。此外,我们的方法在跨架构设置中保持了稳健的性能,在四种架构上的最大性能下降仅为 1.7%。代码可在 https://github.com/VincenDen/IID 获取。

关键词

引用

@article{arxiv.2404.00563,
  title  = {Exploiting Inter-sample and Inter-feature Relations in Dataset Distillation},
  author = {Wenxiao Deng and Wenbin Li and Tianyu Ding and Lei Wang and Hongguang Zhang and Kuihua Huang and Jing Huo and Yang Gao},
  journal= {arXiv preprint arXiv:2404.00563},
  year   = {2024}
}

备注

Accepted to CVPR 2024