压缩、恢复与重标:从新视角看 ImageNet 规模的数据集蒸馏
计算机视觉与模式识别
2024-02-13 v3 人工智能
机器学习
摘要
我们提出一种称为压缩、恢复与重标(SReL)的新数据集蒸馏框架,其在训练期间解耦模型与合成数据的双层优化,以处理不同规模的数据集、模型架构和图像分辨率,实现高效数据集蒸馏。所提方法在多样数据集规模上展现灵活性,并在合成图像的任意分辨率、高分辨率合成下的低训练成本与内存消耗,以及扩展到任意评估网络架构的能力方面具有多重优势。我们在 Tiny-ImageNet 与完整 ImageNet-1K 数据集上进行了大量实验。在 50 IPC 下,我们的方法在 Tiny-ImageNet 和 ImageNet-1K 上分别取得最高的 42.5% 和 60.8% 验证准确率,以 14.5% 和 32.9% 的幅度优于此前所有最先进方法。我们的方法在速度上还超越 MTT,在数据合成期间分别快约 52(ConvNet-4)和 16(ResNet-18),且内存消耗降低 11.6 和 6.4。我们的代码及 50、200 IPC 与 4K 恢复预算的蒸馏数据集见 https://github.com/VILA-Lab/SRe2L。
引用
@article{arxiv.2306.13092,
title = {Squeeze, Recover and Relabel: Dataset Condensation at ImageNet Scale From A New Perspective},
author = {Zeyuan Yin and Eric Xing and Zhiqiang Shen},
journal= {arXiv preprint arXiv:2306.13092},
year = {2024}
}
备注
NeurIPS 2023 spotlight. Code at https://github.com/VILA-Lab/SRe2L