中文

合成数据训练下模型行为特征化:跨尺度与混合比例的实证研究

计算与语言 2025-10-08 v1

摘要

由大型语言模型生成的合成数据已成为现代 NLP 训练管道的重要组成部分,从引导推理能力到增强指令遵循数据集。尽管近期工作表明成功应用可维持高外部数据比例,但系统性地理解合成数据比例如何影响不同规模下的模型行为仍有限。本文提出了受控实证研究,考察在不同合成数据比例下模型性能、校准和输出特征。我们使用 Pythia 模型套件(410M-12B 参数)跨越五种多样化任务,评估在合成数据比例从 0% 到 50% 的情况下进行一次至三次训练迭代后的模型。我们的关键发现包括:模型在合成数据比例达到 20% 时保持稳定性能,但超过 30% 时 degradation 加剧;更大模型(6.9B-12B)对合成数据更鲁�健;校准退化先于准确率损失,提供早期警示信号;任务特性 Matters,推理任务在合成数据训练下比检索任务退化更快。重要的是,我们发现当前最佳实践(如 STaR 和 Self-Instruct 系统维持大于 80% 外部数据)处于本实验确定的安全区域内。我们为实践者提供了基于模型规模和任务要求的合成数据预算指导,并对比详细地说明了包括 Shumailov 等人模型崩溃发现的同步工作。

关键词

引用

@article{arxiv.2510.05133,
  title  = {Characterizing Model Behavior Under Synthetic Data Training: An Empirical Study Across Scales and Mixing Ratios},
  author = {Y. Du and G. Wu and G. Tang and W. Wang and Q. Fan},
  journal= {arXiv preprint arXiv:2510.05133},
  year   = {2025}
}

备注

17 pages. Technical report