中文

PivotRL:低计算成本的高精度智能体后训练

人工智能 2026-03-24 v1

摘要

后训练长期智能体任务存在计算效率与泛化之间的张力。虽然监督微调(SFT)计算高效,但常因在域外(OOD)恶化而受限。相反,端到端强化学习(E2E RL)保留 OOD 能力,但因大量 on-policy rollout 而导致高计算成本。我们引入 PivotRL,一种新框架,基于现有 SFT 轨迹,结合 SFT 的计算效率与 E2E RL 的 OOD 准确性。PivotRL 依赖两个关键机制:首先,它执行局部 on-policy rollout 并筛选出 pivot:即采样动作在结果上表现出高方差的中间步骤;其二,它利用对功能等价动作的奖励,而非对 SFT 数据演示进行严格的字符串匹配。我们理论上表明,这些机制激励强大的学习信号,具有高自然梯度范数,同时最大限度地保留与训练任务无关的动作概率排序。在与相同数据上的标准 SFT 相比,我们展示了 PivotRL 在四个智能体领域中平均实现 +4.17% 的原地准确率,在非智能体任务中实现 +10.04% 的 OOD 准确率。值得注意的是,在智能体编码任务中,PivotRL 仅需 E2E RL 的 4 倍 rollout 步数即可实现竞争准确率。PivotRL 已被采纳为 NVIDIA 的 Nemotron-3-Super-120B-A12B 的生产规模智能体后训练的核心引擎。

关键词

引用

@article{arxiv.2603.21383,
  title  = {PivotRL: High Accuracy Agentic Post-Training at Low Compute Cost},
  author = {Junkeun Yi and Damon Mosk-Aoyama and Baihe Huang and Ritu Gala and Charles Wang and Sugam Dipak Devare and Khushi Bhardwaj and Abhibha Gupta and Oleksii Kuchaiev and Jiantao Jiao and Jian Zhang and Venkat Srinivasan},
  journal= {arXiv preprint arXiv:2603.21383},
  year   = {2026}
}

备注

22 pages, 5 figures, 6 tables