PiCA:基于轴心的搜索型强化学习信用分配
人工智能
2026-05-13 v2
摘要
基于强化学习训练的大型语言模型(LLM)搜索智能体显著提高了知识密集型任务的性能。然而,现有方法在长程信用分配中面临关键挑战:(i)奖励稀疏,模型仅接收结果反馈,无法在步骤级别获得指导以区分动作质量;(ii)信用孤立,信用被分配到独立的步骤,无法捕捉序列依赖性;(iii)分布迁移,奖励在与模型自然生成分布偏离的模板上进行估计。为解决这些问题,我们提出轴心信用分配(PiCA),这是一种新的步骤奖励机制,将搜索轨迹重新构构为累积搜索进度的序列过程。与先前的独立步骤奖励不同,PiCA定义基于潜在基于奖励整形(PBRS)的成功概率的过程奖励。该方法识别轴心步骤,这些步骤包含来自历史轨迹的目标黄金子查询和子答案,作为显著提升正确最终答案概率的信息峰。通过将这些步骤奖励锚定在最终任务目标上,PiCA提供稠密、轴心感知且与轨迹相关的指导,同时保持分布一致性。广泛的实验表明,PiCA在七个知识密集型QA基准中优于现有强大基线,为3B和7B模型分别实现了15.2%和2.2%的改进。各种模型持续的性能提升表明PiCA具有稳健的泛化能力。代码可在https://github.com/novdream/PiCA获取。
引用
@article{arxiv.2605.09287,
title = {PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning},
author = {Dongyi Liu and Yifan Niu and Qinwen Wang and Han Xiao and Jia Li},
journal= {arXiv preprint arXiv:2605.09287},
year = {2026}
}
备注
21 pages, 7 figures