OASES:面向智能搜索的结果对齐搜索-评估协训练框架
人工智能
2026-05-26 v3 计算与语言
信息检索
摘要
智能搜索使语言模型能够通过自适应获取外部证据来解决知识密集型任务。基于可验证奖励的强化学习(RLVR)已成为搜索智能体的广泛采用的训练范式,但仅凭结果奖励稀疏且为中间搜索动作提供有限的信用分配。现有的过程奖励方法因此寻求通过代理信号、外部评估器或基于概率率的信息增益来稠密化监督。然而,代理奖励可能偏离最终结果目标,而固定评估器随着搜索策略的演变而变得陈旧,导致过程监督不可靠。为解决这些挑战,我们提出了 OASES(Outcome-Aligned Search-Evaluation Supervision),一个面向智能搜索的结果对齐搜索-评估监督框架。OASES 通过评估每个中间搜索状态是否支持回答原始问题来派生结果对齐的过程奖励。它进一步在策略上协训练搜索策略和状态评估器,使评估器能够适应不断演变的搜索行为并提供更可靠的过程奖励。在五个多跳 QA 基准测试上进行的实验表明,OASES 在强大的 RL 基线上 consistently 取得优异表现,进一步分析确认了结果对齐过程奖励和搜索-评估协训练的优势。
引用
@article{arxiv.2604.03675,
title = {OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search},
author = {Erhan Zhang and Yiqun Chen and Zechun Niu and Wei Yang and Xiaochi Wei and Yan Gao and Yi Wu and Yao Hu and Jiaxin Mao},
journal= {arXiv preprint arXiv:2604.03675},
year = {2026}
}