中文

ToolPRMBench:面向工具使用智能体的过程奖励模型评估与推进

人工智能 2026-01-21 v1 软件工程

摘要

奖励引导的搜索方法通过有效引导复杂动作空间上的采样与探索,在增强工具使用智能体方面展现出强大潜力。作为核心设计,这些搜索方法利用过程奖励模型(PRM)提供步骤级奖励,从而实现更细粒度的监控。然而,在工具使用场景中,缺乏系统且可靠的 PRM 评估基准。本文介绍了 ToolPRMBench,这是一个专为评估工具使用智能体的 PRM 而设计的大规模基准。ToolPRMBench 构建于多个代表性工具使用基准之上,并将智能体轨迹转换为步骤级测试用例。每个用例包含交互历史、一个正确动作、一个看似合理但错误的替代动作以及相关工具元数据。我们分别利用离线采样来隔离局部单步错误,并利用在线采样来捕获完整智能体运行中的真实多步失败。我们提出了一种多 LLM 验证流程,以减少标签噪声并确保数据质量。我们在 ToolPRMBench 上对大型语言模型、通用 PRM 和工具专用 PRM 进行了广泛实验。结果揭示了 PRM 有效性的明显差异,并凸显了工具专用 PRM 的潜力。代码和数据将在 https://github.com/David-Li0406/ToolPRMBench 发布。

关键词

引用

@article{arxiv.2601.12294,
  title  = {ToolPRMBench: Evaluating and Advancing Process Reward Models for Tool-using Agents},
  author = {Dawei Li and Yuguang Yao and Zhen Tan and Huan Liu and Ruocheng Guo},
  journal= {arXiv preprint arXiv:2601.12294},
  year   = {2026}
}

备注

under review