中文

Synthetic Data RL:任务定义即所需

计算与语言 2025-05-26 v1 人工智能 机器学习

摘要

强化学习 (RL) 是一种强大的适应基础模型以应对特定任务的方法,但其对大规模人工标注数据的依赖限制了广泛采用。我们引入 Synthetic Data RL,这是一个简单且通用的框架,仅使用来自任务定义的合成数据对模型进行强化微调。该方法首先从任务定义和检索文档中生成问答对,然后根据模型的可解难度调整问题难度,并选择模型在样本上平均通过率用于 RL 训练。在 Qwen-2.5-7B 上,我们的方法在 GSM8K 上实现了相较基线模型的 29.2% 绝对提升(相较 instruction-tuned 提升 2.9 pp,相较 Self-Instruct 提升 6.6 pp),在 MATH 上提升 8.7%,在 GPQA 上提升 13.1%(相较 SynthLLM 提升 7.0 pp),在 MedQA 上提升 8.9%,在 CQA (法律) 上提升 17.7%,在 CFA (金融) 上提升 13.7%。在相同数据预算下,Synthetic Data RL 超越了监督微调,在多个数据集上几乎匹配全人类数据下的 RL 效果(例如 GSM8K 上提升 17.2 pp)。仅添加 100 个人类演示,GSM8K 的提升仅为 0.4 pp,表明其额外价值有限。通过减少人类数据标注,Synthetic Data RL 实现了可扩展且高效的 RL 模型适应。代码和演示地址:https://github.com/gydpku/Data_Synthesis_RL/

关键词

引用

@article{arxiv.2505.17063,
  title  = {Synthetic Data RL: Task Definition Is All You Need},
  author = {Yiduo Guo and Zhen Guo and Chuanwei Huang and Zi-Ang Wang and Zekai Zhang and Haofei Yu and Huishuai Zhang and Yikang Shen},
  journal= {arXiv preprint arXiv:2505.17063},
  year   = {2025}
}