RLFactory:面向 LLM 多轮工具使用的即插即用强化学习后训练框架
机器学习
2025-09-10 v1 人工智能
摘要
大型语言模型擅长基础推理,但在需要与外部工具交互的任务中表现不佳。我们提出了 RLFactory,一个用于多轮工具使用的即插即用强化学习后训练框架。RLFactory 通过基于 asyncio 的异步调用器和解耦的工具/训练架构,解决了工具异构性和接口问题下的 (i) 工具调用稳定性和适应性;并通过支持基于规则的、模型判断的和工具验证信号的奖励层,解决了 (ii) 多样化的评估需求。它通过引入来自工具反馈的观测标记重构 MDP,闭合了模型、工具和环境之间的环路,并实现了生成-解析-调用-更新的工作流以进行动态策略优化。在配备 Qwen3-4B 的 Search-R1 上,RLFactory 在 Natural Questions (NQ) 数据集上取得了 0.486 的测试分数,超越了使用类似技术训练的更大模型(例如得分为 0.473 的 Qwen2.5-7B-Instruct-GRPO),并将训练吞吐量提高了 6.8 倍。RLFactory 提供了一个低门槛、高度适应性的框架,用于在真实场景中增强 LLM 的多轮工具使用。代码:https://github.com/Simple-Efficient/RL-Factory。
引用
@article{arxiv.2509.06980,
title = {RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use},
author = {Jiajun Chai and Guojun Yin and Zekun Xu and Chuhuai Yue and Yi Jia and Siyu Xia and Xiaohan Wang and Jiwen Jiang and Xiaoguang Li and Chengqi Dong and Hang He and Wei Lin},
journal= {arXiv preprint arXiv:2509.06980},
year = {2025}
}