中文

错误合成数据上的强化学习以八倍比例提升LLM数学推理效率

机器学习 2024-06-21 v1 计算与语言

摘要

训练模型生成的合成数据是微调大语言模型(LLM)的有前景的方法,但尚不清楚何时有助于何时损害。在本文中,我们通过实证研究探索此问题,然后构建概念性理解。首先,我们发现,虽然通常通过对来自高效能模型生成的合成正确或正问题-解对进行微调可获得有限性能提升,但从微调后的学习者自身获取更多正确解答,然后在此自生成数据上进行后续微调可实现相同合成问题的效率翻倍。同时,训练在模型生成的正面数据上可放大各种伪相关性,导致随数据量增加而呈现平坦甚至负相关趋势。令人惊讶的是,我们发现若也利用负响应——即由最终答案验证器判定为不正确的模型生成响应——则可解决上述问题。关键在于,这些负面响应必须以能够恰当恢复每个中间步骤在负面响应中的效用或优势的方式进行构造。通过此分步方案,我们能够获得持续优于仅使用正面数据的性能,达到类似放大合成数据量 8×8 \times 的性能。我们表明,训练在分步负面数据上可帮助忘记正面数据中的伪相关性,并等价于优势加权强化学习(RL),表明其继承了RL相对于仅模仿正面数据的鲁棒性优势。

关键词

引用

@article{arxiv.2406.14532,
  title  = {RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold},
  author = {Amrith Setlur and Saurabh Garg and Xinyang Geng and Naman Garg and Virginia Smith and Aviral Kumar},
  journal= {arXiv preprint arXiv:2406.14532},
  year   = {2024}
}