S$^2$R: 通过强化学习教导LLM自验证与自纠正
计算与语言
2025-02-19 v1 机器学习
摘要
最近的研究表明,LLM测试时扩展有效。然而,现有的激励LLM深度思考能力的方法通常需要大规模数据或显著的训练工作。同时,如何提高较弱基准模型的思考能力仍不明确。在本工作中,我们引入SR,一个高效框架,通过教导模型在推理期间自我验证和自我纠正来增强LLM推理能力。具体而言,我们首先通过在精心策划的数据上进行监督式微调来初始化LLMs,以实现迭代的自我验证和自我纠正行为。随后,通过结果层面和过程层面的强化学习进一步加强自我验证和自我纠正技能,所需资源最小化,使模型能够在推理期间自适应地细化其推理过程。我们的结果表明,仅需3.1k个自我验证和自我纠正行为初始化样本,Qwen2.5-math-7B即可实现从51.0%到81.6%的准确率提升,超越了在等效数量的长链CoT蒸馏数据上训练的模型。基于三个基准模型进行的大量实验和分析,在both in-domain和out-of-domain基准上验证了SR的有效性。我们的代码和数据已公开于https://github.com/NineAbyss/S2R。
引用
@article{arxiv.2502.12853,
title = {S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning},
author = {Ruotian Ma and Peisong Wang and Cheng Liu and Xingyan Liu and Jiaqi Chen and Bang Zhang and Xin Zhou and Nan Du and Jia Li},
journal= {arXiv preprint arXiv:2502.12853},
year = {2025}
}