中文

通过极小极大扩散的高效数据集蒸馏

计算机视觉与模式识别 2024-03-26 v2

摘要

数据集蒸馏通过生成一个小规模代理数据集来封装原始大规模数据集的丰富信息,从而降低训练网络的存储与计算消耗。然而,先前的蒸馏方法严重依赖逐样本迭代优化方案。随着每类图像数(IPC)设置或图像分辨率的增大,所需计算将耗费压倒性的时间与资源。在这项工作中,我们意图结合生成式扩散技术来计算代理数据集。观察到构建有效代理数据集的关键因素是代表性与多样性,我们在生成式训练中设计额外的极小极大准则以增强扩散模型所生成图像的这些方面。我们给出了该过程的作为分层扩散控制的理论模型,展示了扩散过程在不损害样本对目标分布的忠实性的前提下针对这些准则的灵活性。所提方法在大幅降低计算资源需求的同时取得了最先进的验证性能。在 ImageWoof 的 100-IPC 设置下,我们的方法所需蒸馏时间不到先前方法的二十分之一,却取得了更优性能。源代码与生成数据见 https://github.com/vimar-gu/MinimaxDiffusion。

关键词

引用

@article{arxiv.2311.15529,
  title  = {Efficient Dataset Distillation via Minimax Diffusion},
  author = {Jianyang Gu and Saeed Vahidian and Vyacheslav Kungurtsev and Haonan Wang and Wei Jiang and Yang You and Yiran Chen},
  journal= {arXiv preprint arXiv:2311.15529},
  year   = {2024}
}

备注

CVPR 2024