中文

LeTS:通过过程奖励与结果奖励混合化学习思考与搜索

计算与语言 2025-05-26 v1

摘要

大型语言模型(LLM)凭借 OpenAI-o1 和 DeepSeek-R1 等推理模型的出现,展现了令人瞩目的推理能力。近期研究聚焦于通过基于结果监督的强化学习(RL)方法将推理能力融入检索增强生成(RAG)领域,而对中间思考与搜索步骤的正确性通常被忽视。为解决这一问题,我们设计了一个过程级奖励模块,以缓解结果级监督对中间推理步骤的忽视,且无需额外标注。在此基础上,我们提出了 LeTS(Learning to Think-and-Search),一种将逐步过程奖励与基于结果的奖励混合到当前 RAG 强化学习方法中的新框架。大量实验验证了 LeTS 在各种 RAG 基准上的泛化性与推理效率。此外,这些结果揭示了过程奖励与结果奖励混合化在通过 RL 提升 LLM 推理能力方面的潜力,适用于其他场景。代码将很快发布。

关键词

引用

@article{arxiv.2505.17447,
  title  = {LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization},
  author = {Qi Zhang and Shouqing Yang and Lirong Gao and Hao Chen and Xiaomeng Hu and Jinglei Chen and Jiexiang Wang and Sheng Guo and Bo Zheng and Haobo Wang and Junbo Zhao},
  journal= {arXiv preprint arXiv:2505.17447},
  year   = {2025}
}

备注

preprint, under review