中文

基于神经特征函数的数据集蒸馏:极小极大视角

计算机视觉与模式识别 2025-03-03 v1 人工智能 机器学习

摘要

数据集蒸馏已成为深度学习中减少数据需求的一种强大方法。在各种方法中,基于分布匹配的方法因其在计算效率和强大性能之间的平衡而脱颖而出。然而,分布匹配中使用的现有距离度量往往无法准确捕捉分布差异,导致不可靠的差异度量。在本文中,我们将数据集蒸馏重新表述为极小极大优化问题,并引入了神经特征函数差异 (NCFD),这是一种用于衡量分布差异的全面且有理论依据的度量。NCFD 利用特征函数 (CF) 来封装完整的分布信息,采用神经网络优化 CF 频率参数的采样策略,从而最大化差异以增强距离估计。同时,我们在这种优化的 NCFD 度量下最小化真实数据与合成数据之间的差异。我们的方法被称为神经特征函数匹配 (\mymethod{}),它在复平面上本质上对齐了真实数据和合成数据的神经特征的相位与幅度,在合成样本的真实性与多样性之间取得了平衡。实验表明,我们的方法在低分辨率和高分辨率数据集上均比最先进的方法取得了显著的性能提升。值得注意的是,我们在 ImageSquawk 上实现了 20.5\% 的准确率提升。与最先进的方法相比,我们的方法还将 GPU 内存使用量减少了 300×\times 以上,并实现了 20×\times 的处理速度提升。据我们所知,这是首个在单块 NVIDIA 2080 Ti GPU 上仅使用 2.3 GB 内存实现 CIFAR-100 无损压缩的工作。

关键词

引用

@article{arxiv.2502.20653,
  title  = {Dataset Distillation with Neural Characteristic Function: A Minmax Perspective},
  author = {Shaobo Wang and Yicun Yang and Zhiyuan Liu and Chenghao Sun and Xuming Hu and Conghui He and Linfeng Zhang},
  journal= {arXiv preprint arXiv:2502.20653},
  year   = {2025}
}

备注

Accepted by CVPR 2025, 11 pages, 7 figures