VerlTool:迈向整体式智能体工具使用强化学习
人工智能
2025-10-20 v3 计算与语言
计算机视觉与模式识别
摘要
基于可验证奖励的强化学习 (RLVR) 在增强大语言模型 (LLM) 推理能力方面已取得成功,但仍局限于无工具集成的单轮交互。尽管近期出现了面向多轮工具交互的智能体工具使用强化学习 (ARLT) 方法,但现有工作开发的任务特定代码库存在碎片化、同步执行瓶颈和跨领域可扩展性有限等问题。这些低效阻碍了更广泛的社区采用和算法创新。我们引入了 VerlTool,一个通过系统性设计原则解决这些局限性的统一模块化框架。VerlTool 提供四项关键贡献:(1) 与 VeRL 的上游对齐,确保兼容性和简化维护;(2) 通过标准化 API 进行统一工具管理,支持包括代码执行、搜索、SQL 数据库和视觉处理在内的多种模态;(3) 异步 rollout 执行,通过消除同步瓶颈实现近 2 倍的加速;(4) 全面的评估,在 6 个 ARLT 领域展示了有竞争力的性能。我们的框架将 ARLT 形式化为具有多模态观察令牌(文本/图像/视频)的多轮轨迹,扩展了单轮 RLVR 范式。我们在数学推理、知识问答、SQL 生成、视觉推理、网页搜索和软件工程任务上训练和评估模型,取得了与专用系统相当的结果,同时提供了统一的训练基础设施。模块化的插件架构只需轻量级的 Python 定义即可实现快速工具集成,显著降低了开发开销,并为工具增强的 RL 研究提供了可扩展的基础。我们的代码已在 https://github.com/TIGER-AI-Lab/verl-tool 开源。
引用
@article{arxiv.2509.01055,
title = {VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use},
author = {Dongfu Jiang and Yi Lu and Zhuofeng Li and Zhiheng Lyu and Ping Nie and Haozhe Wang and Alex Su and Hui Chen and Kai Zou and Chao Du and Tianyu Pang and Wenhu Chen},
journal= {arXiv preprint arXiv:2509.01055},
year = {2025}
}
备注
32 pages, 5 figures, 13 tables