知识图谱路径作为自演化搜索代理的中间监督
人工智能
2026-05-08 v1
摘要
自演化搜索代理通过自行生成和求解搜索任务来减少对人类编写训练问题的依赖。我们基于 Search Self-Play(SSP), 即代表性的 Proposer 和 Solver 框架进行扩展, 其中问题通过多步搜索和推理被生成和解答。实际应用中, SSP 面临两个瓶颈: Proposer 仅凭孤立的答案实体构建问题, 缺乏关系上下文, 导致早期自我对弈训练中大量无效或不可验证的问题;而 Solver 仅接收二元结果奖励, 丢弃了部分在轨迹过程中获得的有用信号。我们通过复用知识图谱路径作为构建导向的中间监督来解决上述两个瓶颈, 同时为问题构建和奖励塑形提供支持。首先, 我们在 LLM 指导下基于知识图谱子图对问题构建进行 grounding, 为 Proposer 提供关系上下文。其次, 我们观察到构建和解答多跳问题可涉及重叠的中间实体: 用于构建问题的事实桥梁可能为解答问题提供近似路径。利用这一重叠性, 我们引入了 Waypoint Coverage Reward(WCR), 根据其覆盖构建路径上实体的程度对错误的 Solver 轨迹给予分级的部分奖励, 同时对正确答案保持完整奖励。在七个 QA 基准和九种模型配置上, 我们的方法在所有配置中均优于标准 SSP, 包括在多跳 QA 任务上实现显著提升。这些结果表明, 知识图谱路径可作为轻量级中间监督被复用, 在无需额外任务特定人工标注或手动标记过程步骤的情况下, 提供关系引导和过程反馈。
引用
@article{arxiv.2605.05702,
title = {Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents},
author = {Huyu Wu and Jun Liu and Xiaochi Wei and Yan Gao and Yi Wu and Yao Hu},
journal= {arXiv preprint arXiv:2605.05702},
year = {2026}
}