用于推理与工具使用的合成数据生成与多步强化学习
人工智能
2025-04-29 v2 计算与语言
机器学习
摘要
强化学习已被证明可提高大型语言模型的性能。然而,传统方法如RLHF或RLAIF将问题视为单步问题。随着对更复杂推理和智能体任务的关注,语言模型必须在生成解答前采取多次文本生成、推理和环境交互。我们提出一种针对多步优化场景的合成数据生成与强化学习方法。该方法称为 Step-Wise Reinforcement Learning(SWiRL),迭代生成多步推理与工具使用数据,然后从该数据中学习。它采用简单的分步分解,将每个多步轨迹分解为对应于原始模型每个动作的多个子轨迹,然后对这些子轨迹应用合成数据过滤和强化学习优化。在多个多步工具使用、问答和数学推理任务上进行评估。我们的实验表明,SWiRL在GSM8K、HotPotQA、CofCA、MuSiQue和BeerQA上的相对准确率分别提高了21.5%、12.3%、14.8%、11.1%和15.3%。令人振奋的是,该方法在任务之间 exhibits generalization:例如,仅在HotPotQA(文本问答)上训练,即可在GSM8K(数学数据集)上实现零样本性能提升,提升16.9%。
关键词
引用
@article{arxiv.2504.04736,
title = {Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use},
author = {Anna Goldie and Azalia Mirhoseini and Hao Zhou and Irene Cai and Christopher D. Manning},
journal= {arXiv preprint arXiv:2504.04736},
year = {2025}
}