中文

PRInTS:面向长时程信息寻求的奖励建模

人工智能 2025-11-25 v1 计算与语言 机器学习

摘要

信息寻求是AI智能体的核心能力,要求其在跨越长时间轨迹的工具生成信息上进行收集与推理。然而,基于语言模型的智能体在处理多步骤信息寻求任务方面仍面临挑战。虽然过程奖励模型(PRM)可通过在测试时对候选步骤进行排序来指导智能体,但现有PRM设计用于短时推理的二元判断,无法捕捉信息寻求步骤中 richer 的维度,如工具交互和对工具输出的推理,亦无法处理长时程任务中快速增长的上下文。为此,我们引入PRInTS,一个具备双重能力的生成式PRM:(1)基于PRM对多个步骤质量维度(如工具输出解读、工具调用信息性)进行稠密评分;(2)轨迹总结压缩不断增长的上下文,同时保留步骤评估所必需的关键信息。广泛的评估覆盖FRAMES、GAIA(1-3级)以及WebWalkerQA(易-难)基准测试,并在多个模型上进行消融实验,表明使用PRInTS进行最佳步采样,可提升开源模型及专用智能体的信息寻求能力,匹配甚至超越前沿模型,同时仅用更小规模的 backbone 智能体即可实现。

关键词

引用

@article{arxiv.2511.19314,
  title  = {PRInTS: Reward Modeling for Long-Horizon Information Seeking},
  author = {Jaewoo Lee and Archiki Prasad and Justin Chih-Yao Chen and Zaid Khan and Elias Stengel-Eskin and Mohit Bansal},
  journal= {arXiv preprint arXiv:2511.19314},
  year   = {2025}
}

备注

18 pages, code: https://github.com/G-JWLee/PRInTS