数据蒸馏可如伏特加:多蒸几次以提升质量
计算机视觉与模式识别
2023-10-12 v1 机器学习
摘要
数据集蒸馏旨在通过在大型数据集上创建一小组合成图像来最小化训练深度网络所需的时间和内存,这些图像具有与完整数据集相似的泛化性能。然而,当前的数据集蒸馏技术存在不足,与在原始数据上训练相比表现出显著的性能差距。在这项工作中,我们首次提出仅使用单一合成子集进行蒸馏无法产生最优泛化性能。这是因为深度网络的训练动态在训练过程中剧烈变化。因此,需要多个合成子集来捕捉训练不同阶段的训练动态。为解决此问题,我们提出渐进式数据集蒸馏(Progressive Dataset Distillation, PDD)。PDD 合成多小组成成图像,每组以先前的集合为条件,并在这些子集的累积并集上训练模型而无需额外训练时间。我们的大量实验表明,PDD 能将现有数据集蒸馏方法的性能有效提升高达 4.3%。此外,我们的方法首次使得生成相当大的合成数据集成为可能。
引用
@article{arxiv.2310.06982,
title = {Data Distillation Can Be Like Vodka: Distilling More Times For Better Quality},
author = {Xuxi Chen and Yu Yang and Zhangyang Wang and Baharan Mirzasoleiman},
journal= {arXiv preprint arXiv:2310.06982},
year = {2023}
}
备注
Preprint