中文

OThink-SRR1:基于强化学习的大型语言模型搜索、精炼与推理

计算与语言 2026-04-23 v1 人工智能

摘要

检索增强生成(RAG)扩展了大型语言模型(LLM)的知识,然而当前的静态检索方法在处理复杂的多跳问题时面临困难。尽管近期的动态检索策略有所改进,但它们面临两个关键挑战:1)检索到的无关噪声会误导推理过程,2)处理完整文档会带来过高的计算和延迟成本。为了解决这些问题,我们提出了 OThink-SRR1,这是一个通过强化学习训练的迭代“搜索-精炼-推理”过程来增强大型模型的框架。其核心的精炼阶段在推理之前将检索到的文档提炼为简洁、相关的事实。我们引入了 GRPO-IR,一种端到端的强化学习算法,该算法奖励准确的证据识别并惩罚过度检索,从而训练模型既专注又高效。在四个多跳问答基准上的实验表明,与强基线相比,我们的方法在使用更少检索步骤和 token 的情况下实现了更高的准确率。这使得 OThink-SRR1 成为信息检索智能体的强大基础模型。

关键词

引用

@article{arxiv.2604.19766,
  title  = {OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models},
  author = {Haijian Liang and Zenghao Niu and Junjie Wu and Changwang Zhang and Wangchunshu Zhou and Jun Wang},
  journal= {arXiv preprint arXiv:2604.19766},
  year   = {2026}
}