中文

通过谱滤波理解数据蒸馏

计算机视觉与模式识别 2026-03-16 v2 机器学习

摘要

数据蒸馏(DD)已成为压缩数据集以加速模型训练的有前景方法。然而,各种 DD 方法之间的内在联系仍基本未被探索。本文引入 UniDD,一个统一的谱滤波框架,以统一不同 DD 目标。UniDD 将每个 DD 目标解释为特定的滤波函数,其影响特征-特征相关矩阵(FFC)的特征值,并调制特征-标签相关矩阵(FLC)的频率分量。如此,UniDD 揭示了数据蒸馏本质在于匹配特定频率的特征。此外,根据滤波行为,我们将现有方法归类为低频匹配和高频匹配,分别编码全局纹理和局部细节。然而,现有方法依赖于在整个蒸馏过程中使用固定滤波函数,无法同时捕获低频和高频信息。为此,我们进一步提出课程频率匹配(CFM),逐步调整滤波参数以覆盖 FFC 和 FLC 矩阵的低频与高频信息。在小规模数据集如 CIFAR-10/100 以及大规模数据集包括 ImageNet-1K 上的大量实验表明,CFM 在现有基线之上表现出优越性能,验证了 UniDD 的实用性。

关键词

引用

@article{arxiv.2503.01212,
  title  = {Understanding Dataset Distillation via Spectral Filtering},
  author = {Deyu Bo and Songhua Liu and Xinchao Wang},
  journal= {arXiv preprint arXiv:2503.01212},
  year   = {2026}
}

备注

Accepted by ICLR 2026. Code is available at https://github.com/bdy9527/UniDD