中文

SIGHT:基于自证据和信息增益的多样分支搜索强化学习

计算与语言 2026-02-13 v1

摘要

强化学习(RL)已使大型语言模型(LLM)掌握了复杂问答任务中自主搜索的能力。然而,在多轮搜索场景中,这一交互引入了一个关键挑战:搜索结果常常存在高冗余性和低信噪比。因此,代理容易陷入“隧道视野”,即对早期噪声检索的强制解释导致不可逆的错误累积。为解决这些挑战,我们提出了 SIGHT 框架,通过自证据支持(SES)和信息增益驱动的多样分支来增强基于搜索的推理。SIGHT 通过 SES 将搜索结果蒸馏为高保真证据,并计算信息增益得分,以标识观察最大程度减少不确定性的关键状态。该得分指导动态提示干预——包括去重、反思或自适应分支——以 SES 为依据生成新的分支。最后,通过将 SES 与正确性奖励集成到群体相对策略优化中,SIGHT 在无外部验证器的情况下内化稳健的探索策略。实验在单跳和多跳 QA 基准上表明,SIGHT 在复杂推理场景中显著优于现有方法,尤其是在更少的搜索步骤下实现更佳表现。

关键词

引用

@article{arxiv.2602.11551,
  title  = {SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search Agent},
  author = {Wenlin Zhong and Jinluan Yang and Yiquan Wu and Yi Liu and Jianhang Yao and Kun Kuang},
  journal= {arXiv preprint arXiv:2602.11551},
  year   = {2026}
}