资源受限代理的多跳推理:David 能否战胜 Goliath?
计算与语言
2026-05-12 v3
摘要
多轮推理代理通过分解问题为中间检索或工具使用步骤来解决复杂问题,累积支持证据。而 reinforcement learning (RL) 训练这些代理依赖大量 on-policy 演绎和大批量训练数据。在现实资源受限的情况下稠密探索不可行,每个 RL 批次仅包含少量有用的推理路径。现有方法未能完全解决此瓶颈:SFT 初始化在标注轨迹稀缺时容易过拟合,检索级奖励可为单个检索文档分配信用,却未直接优化整个证据集合的覆盖率,扩张操作会浪费来自选错前缀的演绎。我们提出 David-GRPO,通过利用当前策略外部和内部的信息改善小批量学习:(i) 专家引导注入少量 off-policy 专家轨迹至 RL 更新;(ii) 证据引导的探索将 on-policy 的部分成功转化为证据覆盖评分及额外 continuation。在 1.5B 参数规模的代理上使用四块 RTX 3090 GPU 训练,David-GRPO 在六个多跳 QA 基准上优于相同低预算设置下的先前 RL 基线。提升源于行为转变:与先前低预算 RL 基线常跳过检索或仅进行浅层搜索不同,David-GRPO 学习了增加检索深度和证据覆盖的能力。
引用
@article{arxiv.2601.21699,
title = {Can David Beat Goliath? On Multi-Hop Reasoning with Resource-Constrained Agents},
author = {Hojae Han and Heeyun Jung and Jongyoon Kim and Seung-won Hwang},
journal= {arXiv preprint arXiv:2601.21699},
year = {2026}
}
备注
Preprint