中文

Tool Zero:从零开始纯 RL 训练工具增强型 LLM

机器学习 2025-11-11 v2 人工智能

摘要

工具增强型 LLM 的训练已成为提升语言模型在复杂任务中能力的有前景方法。当前的监督微调范式依赖构建大量领域特定数据集来训练模型,但这一方法常常难以有效泛化到陌生或复杂的工具使用情境。最近,强化学习(RL)范式为 LLM 带来了更好的推理和泛化能力。本文回答一个关键问题:纯 RL 是否可有效激发模型内在推理能力并提升工具无关的泛化能力?我们提出一种动态泛化引导奖励设计,用于基于规则的 RL,这会逐步从探索性到利用性的工具使用模式转移奖励。基于此设计,我们引入了 Tool-Zero 系列模型。这些模型被训练以直接通过扩大 RL 从零模型(即无后训练的基础模型)中激发 LLM 自主利用通用工具的能力。实验结果表明,我们的模型在相同的实验设置下,相较于 SFT 和 RL-with-SFT 模型实现超过7%的性能提升。这些收益在跨数据集和数据集内评估中得到一致复制,验证了我们方法的有效性和鲁棒性。

关键词

引用

@article{arxiv.2511.01934,
  title  = {Tool Zero: Training Tool-Augmented LLMs via Pure RL from Scratch},
  author = {Yirong Zeng and Xiao Ding and Yutai Hou and Yuxian Wang and Li Du and Juyi Dai and Qiuyang Ding and Duyu Tang and Dandan Tu and Weiwen Liu and Bing Qin and Ting Liu},
  journal= {arXiv preprint arXiv:2511.01934},
  year   = {2025}
}

备注

EMNLP 2025 finding