中文

数据提炼效用边界: 比例定律与配置覆盖定律

机器学习 2025-12-11 v3

摘要

数据提炼(DD)旨在构建紧凑的合成数据集,使模型在大幅减少存储和计算需求的同时,能够实现与完整数据训练相当的性能。尽管取得了快速的经验性进展,但其理论基础仍有限:现有方法(梯度、分布、轨迹匹配)建立在异构的代理目标和优化假设之上,这使得难以分析其共同原则或提供一般性保证。此外,仍不清楚在训练配置(如优化器、架构或数据增强)发生变化时,提炼数据是否能保留完整数据集的有效性。为回答这些问题,我们提出了一个统一的理论框架,称为配置-动力学-误差分析框架,将主要的 DD 方法在常见的 generalization-error 框架下重新表述,并提供两个主要结果:(i)一种比例定律,提供单一配置的上界,描述误差随提炼样本大小增加而减小的方式,解释常见观察到的性能饱和效应;以及(ii)一种覆盖定律,表明所需的提炼样本规模随配置多样性的线性比例,具有可证明的上界和下界。此外,我们的统一分析揭示了各种匹配方法是可互换的代理方法,化简相同的 generalization 误差,阐明了它们为何都能实现数据提炼,并提供关于代理选择如何影响样本效率和鲁棒性的指导。跨越多种方法和配置的实验经验证实了推导的定律,为 DD 奠定了理论基础,并实现了以理论为导向的紧凑、配置鲁棒的数据提炼。

关键词

引用

@article{arxiv.2512.05817,
  title  = {Utility Boundary of Dataset Distillation: Scaling and Configuration-Coverage Laws},
  author = {Zhengquan Luo and Zhiqiang Xu},
  journal= {arXiv preprint arXiv:2512.05817},
  year   = {2025}
}