中文

Prismatic Synthesis:基于梯度的数据多样化提升 LLM 推理的泛化能力

机器学习 2025-05-27 v1 人工智能 计算与语言

摘要

语言模型的有效泛化关键取决于其训练数据的多样性。然而,现有的多样性度量往往难以达到这一目标,因为它们依赖于与模型行为脱节的表面启发式规则。这促使我们提出问题:训练数据中的哪种多样性真正驱动了语言模型的泛化——我们又该如何测量和放大它?通过对超过 300 次训练运行进行大规模实证分析,并仔细控制数据规模和质量,我们表明数据多样性可以作为 LLM 推理泛化的强预测因子——以模型在未见过的分布外基准上的平均性能来衡量。我们引入了 G-Vendi,这是一种通过模型诱导梯度的熵来量化多样性的指标。尽管使用了一个现成的小型代理模型来计算梯度,G-Vendi 始终优于其他度量方法,在自然语言推理 (NLI) 和数学推理任务上与分布外 (OOD) 性能实现了强相关性 (Spearman's ρ0.9\rho \approx 0.9)。基于这一洞察,我们提出了 Prismatic Synthesis,这是一个通过定位梯度空间中代表性不足的区域来生成多样化合成数据的框架。实验结果表明,随着合成数据规模的扩大,Prismatic Synthesis 持续提升模型性能——不仅在分布内测试中,在未见过的分布外基准上也是如此——显著优于依赖比我们大 20 倍的数据生成器的 SOTA 模型。例如,我们从 32B LLM 蒸馏出的模型 PrismMath-7B,在 7 项具有挑战性的基准中有 6 项上优于 R1-Distill-Qwen-7B——后者是在相同基座模型上使用 671B R1 生成的专有数据训练的。

关键词

引用

@article{arxiv.2505.20161,
  title  = {Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning},
  author = {Jaehun Jung and Seungju Han and Ximing Lu and Skyler Hallinan and David Acuna and Shrimai Prabhumoye and Mostafa Patwary and Mohammad Shoeybi and Bryan Catanzaro and Yejin Choi},
  journal= {arXiv preprint arXiv:2505.20161},
  year   = {2025}
}