数据提炼演化:通向可扩展且通用的解决方案
计算机视觉与模式识别
2025-07-04 v3
摘要
数据提炼将大规模数据集压缩为紧凑的合成表示,已成为高效训练现代深度学习模型的关键解决方案。虽然先前的调查聚焦于2023年前的发展,但本工作综合回顾了近期进展,强调可扩展到大规模数据集(如ImageNet-1K和ImageNet-21K)的能力。我们将进展归类为几个关键方法:轨迹匹配、梯度匹配、分布匹配、可扩展生成方法和解耦优化机制。作为对近期数据提炼进展的全面审查,本综述突显了突破性创新:SRe2L框架实现高效且有效的提炼,软标签策略显著提高模型准确率,无损提炼技术在最大化压缩的同时保持性能。除这些方法论性突破外,我们还讨论了关键挑战,包括对抗性和后门攻击的鲁棒性、处理非独立同分布数据的有效方法。此外,我们探索了在视频和音频处理、多模态学习、医学影像和科学计算中的新兴应用,凸显了其领域的多样性。通过提供广泛的性能比较和可操作的研究方向,本综述为研究人员和实践者提供了实用见解,以推动高效且通用的数据提炼,为未来创新铺平道路。
引用
@article{arxiv.2502.05673,
title = {The Evolution of Dataset Distillation: Toward Scalable and Generalizable Solutions},
author = {Ping Liu and Jiawei Du},
journal= {arXiv preprint arXiv:2502.05673},
year = {2025}
}
备注
Dr. Jiawei Du is the corresponding author