中文

峰-崩溃模式及知识图谱工具使用的四个接口通道

计算与语言 2026-05-26 v1

摘要

我们测试了标准RLVR工具使用配方——在Qwen2.5-7B-Instruct上使用GRPO——针对一个刻意简化的知识图谱工具API:在Complex WebQuestions上进行四个Freebase导航动词。 在自验证检索奖励下,策略的工具 grounding answer rate 从 3.8%3.8\% 上升到 9.6%9.6\% ,然后在单个50步窗口内迅速下跌至 0%0\% ——一种\emph{峰-崩溃}模式在四个随机种子中被复制。 在七种奖励设计中,我们发现四个反复出现的失败模式:添加更密集或更精准的代理奖励会导致失败模式的变化而非消除。我们认为与Python解释器、web search和JSON API的一个关键区别在于接口反馈:它们的失败常常泄露模型在预训练中看到的自然语言信号。Python traceback 指出失败的行;空的 Freebase 结果 \texttt{[]} 则不提供此类线索。剥离这种表层信息后,暴露出一种退化模式,相同家族的奖励重设计无法修复。直接的oracle ablation排除了关系选择:在每次检索调用时注入黄金关系,使 exact-match accuracy 仅提升 +0.20+0.20~pp,且 95.4%95.4\% 的检索相关错误是检索-组合错误而非答案提取错误。作为缓解措施,一次自蒸馊可达到 40.0%40.0\% EM,且具有容量不变性:将容量加倍至14B 仅提升 EM 约 0.250.25~pp,初始化几乎无关紧要—在测试的7B至14B范围内,似乎存在接口限制的天花板。

关键词

引用

@article{arxiv.2605.26037,
  title  = {Peak-Then-Collapse and the Four Interface Channels of Knowledge-Graph Tool Use},
  author = {Tianda Sun and Dimitar Kazakov},
  journal= {arXiv preprint arXiv:2605.26037},
  year   = {2026}
}

备注

18 pages, 9 figures