ToolRM:面向工具调用大语言模型的结果奖励模型
计算与语言
2026-01-08 v2
摘要
随着大型语言模型(LLM)越来越多地与外部工具交互,针对工具使用的奖励建模已成为一个关键且鲜有探索的研究领域。现有的奖励模型主要基于自然语言输出进行训练,难以评估基于工具的推理和执行。为量化这一差距,我们引入了FC-RewardBench——第一个系统评估工具调用场景下奖励模型的基准。我们的分析表明,当前的奖励模型经常错失有效工具使用的关键信号,这凸显了需要特定领域建模的必要性。我们通过使用来自宽松许可的开源大语言模型合成的数据,提出了一个用于结果奖励模型训练的框架。我们引入ToolRM——一个针对工具使用场景的奖励模型系列,参数规模从1.7B到14B不等。在多种设置下,这些模型 consistently优于通用基准。值得注意的是,它们在最佳-N采样下可实现最高25%的改进,同时也提高了对输入噪声的鲁棒性,支持有效的数据过滤,并可用于策略模型的RL训练。
引用
@article{arxiv.2509.11963,
title = {ToolRM: Outcome Reward Models for Tool-Calling Large Language Models},
author = {Mayank Agarwal and Ibrahim Abdelaziz and Kinjal Basu and Merve Unuvar and Luis A. Lastras and Yara Rizk and Pavan Kapanipathi},
journal= {arXiv preprint arXiv:2509.11963},
year = {2026}
}