中文

WILDCHAT-50M:深入探讨合成数据在后训练中的作用

机器学习 2025-05-26 v2 计算与语言

摘要

语言模型(LLM)后训练,从 DPO 到蒸馏,都可以细化行为并开辟新技能,但支持这些后训练技术的开源生态仍处于初级阶段。一个限制因素是,难以进行大规模比较分析合成数据生成模型和 LLM 评判官。为弥合这一差距,我们引入 WILDCHAT-50M,即目前规模最大的公共聊天数据集。我们将现有的 WildChat 数据集扩展到包括来自 GPT 以及超过 50 个不同开源权重模型的响应,这些模型参数规模从 0.5B 到 104B 不等。我们进行了大规模比较分析,展示了该数据集的潜力,通过创建我们自己的公共 SFT 混合物 RE-WILD,证明其仅使用 40% 的样本即可超越来自 Allen AI 的最新 Tulu-3 SFT 混合物。我们的数据集、样本和代码均可在 https://github.com/penfever/wildchat-50m 获取。

关键词

引用

@article{arxiv.2501.18511,
  title  = {WILDCHAT-50M: A Deep Dive Into the Role of Synthetic Data in Post-Training},
  author = {Benjamin Feuer and Chinmay Hegde},
  journal= {arXiv preprint arXiv:2501.18511},
  year   = {2025}
}

备注

ICML 2025