中文

SD-Search:面向搜索增强推理的同策略事后自蒸馏

人工智能 2026-05-19 v1 计算与语言 信息检索

摘要

搜索增强推理智能体将内部推理与对外部检索器的调用交替进行,其性能取决于每次发出查询的质量。然而,在结果奖励强化学习下,一次 rollout 中的每个搜索决策共享相同的轨迹级奖励,导致单个查询缺乏步级信用。近期的过程监督方法通过从策略外部提取步级信号来弥补这一缺陷,它们要么依赖大得多的教师模型,要么依赖由更强的外部系统生成的子问题标注。相比之下,我们提出 SD-Search,通过同策略事后自蒸馏从策略本身导出步级监督,既不需要外部教师,也不需要额外标注。在 SD-Search 中,单个模型扮演仅在条件设定上有所不同的两个角色:一个仅能看到推理时可用上下文的学生,以及一个额外以紧凑的事后块为条件的教师,该事后块总结了从同一问题采样的一组 rollout 的搜索查询与最终结果。由于教师知晓每次 rollout 的演变过程及哪些取得了成功,其查询分布隐式标记了哪些决策值得做出,学生通过在搜索查询位置最小化与教师的 token 级 Jensen--Shannon 散度来训练以恢复这一行为。这在 GRPO 粗略的轨迹奖励之上叠加了密集的步级信号。关键在于,该信号由策略自身在标准 RL 训练循环中产生,无需外部模型推理、辅助标注流程或额外训练阶段。

关键词

引用

@article{arxiv.2605.18299,
  title  = {SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning},
  author = {Yufei Ma and Zihan Liang and Ben Chen and Zhipeng Qian and Huangyu Dai and Lingtao Mao and Xuxin Zhang and Chenyi Lei and Wenwu Ou},
  journal= {arXiv preprint arXiv:2605.18299},
  year   = {2026}
}