通过逆向课程强化学习训练大型语言模型进行推理
人工智能
2024-03-19 v2 计算与语言
机器学习
摘要
在本文中,我们提出了 R:通过逆向课程强化学习(RL)学习推理,这是一种新颖的方法,仅使用结果监督来实现大型语言模型的过程监督优势。将 RL 应用于复杂推理的核心挑战是识别产生正奖励的动作序列并提供适当的优化监督。结果监督为最终结果提供稀疏奖励而不识别错误位置,而过程监督提供逐步奖励但需要大量人工标注。R 通过学习正确的演示来克服这些限制。具体而言,R 逐步将推理的起始状态从演示的结尾滑动到开头,从而促进模型在所有阶段的探索。因此,R 建立了一个逐步课程,使结果监督能够提供步骤级信号并精确定位错误。使用 Llama2-7B,我们的方法在八个推理任务上平均超过 RL 基线 4.1 分。值得注意的是,在 GSM8K 的基于程序的推理中,它在三个骨干模型上超过基线 4.2 分,且无需任何额外数据,Codellama-7B + R 的表现可与更大模型或闭源模型相媲美。
引用
@article{arxiv.2402.05808,
title = {Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning},
author = {Zhiheng Xi and Wenxiang Chen and Boyang Hong and Senjie Jin and Rui Zheng and Wei He and Yiwen Ding and Shichun Liu and Xin Guo and Junzhe Wang and Honglin Guo and Wei Shen and Xiaoran Fan and Yuhao Zhou and Shihan Dou and Xiao Wang and Xinbo Zhang and Peng Sun and Tao Gui and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2402.05808},
year = {2024}
}
备注
Preprint. Codes released: https://github.com/WooooDyy/LLM-Reverse-Curriculum-RL