多尺寸数据集凝练
计算机视觉与模式识别
2024-04-16 v2
摘要
虽然数据集凝练有效提升了训练效率,但其在设备端场景的应用带来了独特的挑战。1) 由于这些设备的计算资源波动,需要灵活的数据集大小,而非预定义的固定大小。2) 设备上有限的计算能力往往阻碍了额外的凝练操作。这两个挑战与传统数据集凝练中的“子集退化问题”相关:从较大凝练数据集中提取的子集,往往不如直接将整个数据集凝练为该较小尺寸时具有代表性。本文提出了多尺寸数据集凝练(MDC),通过将 N 个凝练过程压缩为单个凝练过程,以获得多种尺寸的数据集。具体而言,我们在基本凝练损失之上引入了“自适应子集损失”,以缓解“子集退化问题”。我们的 MDC 方法提供了若干优势:1) 无需额外的凝练过程;2) 通过复用凝练图像降低了存储需求。实验在包括 ConvNet、ResNet 和 DenseNet 的网络以及 SVHN、CIFAR-10、CIFAR-100 和 ImageNet 的数据集上验证了我们的发现。例如,在将 CIFAR-10 凝练为每类十张图像时,我们实现了 5.22%-6.40% 的平均准确率提升。代码地址:https://github.com/he-y/Multisize-Dataset-Condensation。
引用
@article{arxiv.2403.06075,
title = {Multisize Dataset Condensation},
author = {Yang He and Lingao Xiao and Joey Tianyi Zhou and Ivor Tsang},
journal= {arXiv preprint arXiv:2403.06075},
year = {2024}
}
备注
Accepted by ICLR 2024 Oral