强化学习是否扩展了大语言模型代理的能力边界?基于 PASS@(k,T) 的分析
机器学习
2026-04-17 v1
摘要
强化学习是否真正扩展了大语言模型代理能做的事,还是仅仅让它们更可靠?对于静态推理,最近的工作给出了第二个答案:基座模型和 RL pass@k 曲线在较大的 k 值下会收敛。我们询问这种情况是否也适用于代理式工具使用,其中 T 轮交互能够实现组合策略,而重新抽样无法恢复。我们引入 PASS@(k,T),这是一种两种维度的度量标准,同时变化抽样预算 k 和交互深度 T,区分能力扩展与效率改进。我们的主要发现是,与静态推理的结果不同,工具使用 RL 确实扩大了能力边界:RL 代理的 pass 曲线在基座模型之上,且差距在较大的 k 值下扩大而不是收敛。这种扩展是特定于组合的、顺序的信息收集;在更简单的数据集上,RL 的行为与先前的工作预测的一致。在匹配的训练数据下,监督微调会在相同的组合任务上退化该边界,将自我导向的探索 isolating 作为原因。机制分析显示,RL 对基座策略分布进行重新加权,使其下游推理更常导致正确答案的子集,其改进集中在代理如何整合检索信息方面。这些结果调和了对 RL 对大语言模型持有的乐观与悲观解读:两者都正确,但在不同的数据集类型上。
引用
@article{arxiv.2604.14877,
title = {Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis},
author = {Zhiyuan Zhai and Wenjing Yan and Xiaodan Shao and Xin Wang},
journal= {arXiv preprint arXiv:2604.14877},
year = {2026}
}