DataChef:通过强化学习为 LLM 适应生成最优数据配方
计算与语言
2026-03-09 v2 人工智能
摘要
在当前大语言模型(LLM) landscape 中,大规模高质量训练数据的精选是模型性能的主要驱动力。一个关键杠杆是“数据配方”,即一组数据处理管线,用于将原始数据源转化为训练语料。尽管日益广泛地使用 LLM 自动化单个数据处理步骤(如数据合成和筛选),但数据配方的整体设计仍主要是手动且耗时的,需要大量的人类专长和迭代。为弥合这一差距,我们提出面向 LLM 适应的“端到端数据配方生成”。给定目标基准和可用数据源池,模型需输出完整的数据配方,以适配基础 LLM 以完成目标任务。我们提出 DataChef-32B,该模型在线使用代理奖励进行强化学习,该奖励预测来自候选配方的下游性能。对于六个 held-out 任务,DataChef-32B 产生的配方可实现与人类专家精选相当的性能。值得注意的是,DataChef-32B 的配方使 Qwen3-1.7B-Base 适配数学领域,AIME'25 上取得 66.7 分,超越官方 post-training checkpoint(Qwen3-1.7B)。本工作为自动化 LLM 训练和开发自演化 AI 系统开辟了新视野。
引用
@article{arxiv.2602.11089,
title = {DataChef: Cooking Up Optimal Data Recipes for LLM Adaptation via Reinforcement Learning},
author = {Yicheng Chen and Zerun Ma and Xinchen Xie and Yining Li and Kai Chen},
journal= {arXiv preprint arXiv:2602.11089},
year = {2026}
}
备注
20 pages, 11 figures