中文

通过有意练习提高合成数据的数值扩展规律

机器学习 2025-02-24 v1 人工智能

摘要

受人类学习中刻意练习原理的启发,我们提出了合成数据生成的刻意练习 (Deliberate Practice for Synthetic Data Generation, DP) 框架,通过动态合成数据生成来提高样本效率。先前的研究表明,单纯扩大合成数据存在固有的扩展性挑战,因为盲目增加新数据会导致报酬递减。为此,已识别出修剪作为提高扩展性的关键机制,使模型能够聚焦于最具信息性的合成样本。我们的方法不同于先生成大型数据集再进行修剪,而是高效地逼近直接生成信息丰富样本的过程。我们在理论上展示了通过训练具有挑战性且信息丰富的样本可如何提升扩展规律,并通过实验验证,DP 在显著减少训练样本数和迭代次数的同时,实现了更好的扩展性能。在 ImageNet-100 上,DP 仅生成 3.4 倍的样本,所需迭代次数减少 6 倍;在 ImageNet-1k 上,仅生成 8 倍的样本,迭代次数减少 30%,同时实现了优于先前工作的更好性能。

关键词

引用

@article{arxiv.2502.15588,
  title  = {Improving the Scaling Laws of Synthetic Data with Deliberate Practice},
  author = {Reyhane Askari-Hemmat and Mohammad Pezeshki and Elvis Dohmatob and Florian Bordes and Pietro Astolfi and Melissa Hall and Jakob Verbeek and Michal Drozdzal and Adriana Romero-Soriano},
  journal= {arXiv preprint arXiv:2502.15588},
  year   = {2025}
}