RICE-PO:将检索交互转换为推理智能体的信用信号
计算与语言
2026-05-27 v1
摘要
检索正从单次匹配向交互式推理转变,语言智能体不断检查证据、重新表述查询并再次搜索。训练此类智能体面临信用分配挑战:可执行动作如查询或摘要可被检索器直接评估,而潜在推理步骤不可直接观察,仅影响未来的可执行动作。这种不对称使得结果级别的奖励分配不可靠,因为相同的最终奖励可能为并未实际影响检索成功的推理步骤提供信用。我们提出RICE-PO,一个无评论家的策略优化框架,将检索交互转换为局部化的学习信号。RICE-PO选择高不确定性的可执行动作作为锚点,使用检索指标评估局部反事实分支,并仅在推理-动作影响强且未来残差效应稳定时,将信用传递给潜在的推理步骤。在BRIGHT和BEIR上,RICE-PO consistently 在相同的检索器设置下超越基于提示的智能体和基于小组的RL基线。这些结果表明,智能体-环境交互的结构本身可以为训练基于推理的检索智能体提供有用的监督。
引用
@article{arxiv.2605.26352,
title = {RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents},
author = {Mingchen Li and Hansi Zeng and Zhuo Qian and Jiatan Huang and Hamed Zamani and Hong Yu},
journal= {arXiv preprint arXiv:2605.26352},
year = {2026}
}