ReST-MCTS*:通过过程奖励引导树搜索的LLM自训练
计算与语言
2024-11-19 v3
摘要
近期LLM自训练方法大多依赖LLM生成响应并筛选出具有正确输出答案的响应作为训练数据。这种方法通常会产生低质量的微调训练集(例如,错误的计划或中间推理)。在本文中,我们开发了一种称为ReST-MCTS*的强化自训练方法,该方法基于将过程奖励引导与树搜索MCTS*相结合,以收集更高质量的推理轨迹以及每步价值,用于训练策略和奖励模型。ReST-MCTS*通过基于树搜索的强化学习规避了通常用于训练过程奖励的每步手动标注:给定oracle最终正确答案,ReST-MCTS*能够通过估计该步骤有助于得出正确答案的概率来推断正确的过程奖励。这些推断出的奖励具有双重用途:它们作为价值目标用于进一步细化过程奖励模型,并有助于选择高质量轨迹用于策略模型自训练。我们首先表明,在相同搜索预算下,ReST-MCTS*中的树搜索策略相比先前的LLM推理基线(如Best-of-N和思维树)实现了更高的准确率。然后我们表明,通过使用此树搜索策略搜索到的轨迹作为训练数据,我们可以持续增强三个语言模型多个迭代,并优于其他自训练算法,如ReST和Self-Rewarding LM。我们在https://github.com/THUDM/ReST-MCTS上发布所有代码。
引用
@article{arxiv.2406.03816,
title = {ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search},
author = {Dan Zhang and Sining Zhoubian and Ziniu Hu and Yisong Yue and Yuxiao Dong and Jie Tang},
journal= {arXiv preprint arXiv:2406.03816},
year = {2024}
}
备注
Accepted to NeurIPS 2024