中文

数据集蒸馏综述

机器学习 2023-12-27 v4

摘要

在过去十年中,深度学习技术取得了前所未有的发展,并已成为许多应用领域的首选。这一进展主要归功于系统性的协同作用:快速增长的算力促使先进算法能够处理海量数据。然而,用有限的算力处理无限增长的数据逐渐成为一项挑战。为此,人们提出了多种方法来提高数据处理效率。数据集蒸馏作为一种数据集缩减方法,通过从大量数据中合成一个具有代表性的小规模数据集来解决该问题,并引起了深度学习社区的广泛关注。根据是否显式地模拟目标数据的性能,现有的数据集蒸馏方法可被分类为元学习框架和数据匹配框架。尽管数据集蒸馏在数据集压缩方面展现出惊人的性能,但仍存在若干局限性,例如对高分辨率数据或具有复杂标签空间的数据进行蒸馏。本文从多个方面对数据集蒸馏提供了全面的理解,包括蒸馏框架与算法、分解式数据集蒸馏、性能比较以及应用。最后,我们讨论了挑战与有前景的方向,以进一步推动未来关于数据集蒸馏的研究。

关键词

引用

@article{arxiv.2301.05603,
  title  = {A Comprehensive Survey of Dataset Distillation},
  author = {Shiye Lei and Dacheng Tao},
  journal= {arXiv preprint arXiv:2301.05603},
  year   = {2023}
}