中文

规模扩展时代的数据价值:理解真实-合成数据混合下的 LLM 扩展动态

机器学习 2025-11-18 v1 人工智能

摘要

大型语言模型(LLMs)的快速进展得益于对混合真实与合成数据的数据集日益增长的依赖。虽然合成数据提供了可扩展性和成本效益,但它常常引入系统性的分布差异,特别是由于 top-p 采样、温度缩放和有限采样等数据生成机制的截断效应,导致长尾知识代表性不足。这些差异给表征和评估混合真实-合成数据集的效用带来了根本性挑战。在本文中,我们识别出一种以两个断点为特征的三阶段扩展行为,这两个断点反映了模型在学习头部和尾部知识时的行为转变。我们进一步推导了一个针对真实与合成混合数据设计的 LLM 泛化界,揭示了几个控制其泛化性能的关键因素。基于我们的理论发现,我们提出了一种有效且高效的数据估值方法,该方法可扩展至大规模数据集。在包括图像分类、情感分类、指令遵循和复杂推理在内的四项任务上的综合实验表明,我们的方法在数据估值方面超越了最先进的基线方法,且计算成本显著降低。

关键词

引用

@article{arxiv.2511.13640,
  title  = {Data Value in the Age of Scaling: Understanding LLM Scaling Dynamics Under Real-Synthetic Data Mixtures},
  author = {Haohui Wang and Jingyuan Qi and Jianpeng Chen and Jun Wu and Lifu Huang and Lecheng Zheng and Kevin Choi and Balaji Veeramani and Edward Bowen and Alison Hu and Tyler Cody and Dawei Zhou},
  journal= {arXiv preprint arXiv:2511.13640},
  year   = {2025}
}