ToolExpander:扩展工具使用强化学习在弱 LLM 中的前沿
计算与语言
2025-10-10 v1 机器学习
摘要
使用群体相对策略优化(GRPO)训练大型语言模型(LLM)时,面临一个显著挑战:模型常常无法产生准确的响应,尤其是在小型架构上。这一限制不仅会削弱性能提升,还会损害 GRPO 的潜力,频繁导致训练中期崩溃,严重影响训练稳定性和最终效果。为此,我们提出了 ToolExpander,一种创新的框架,通过两个关键创新拓展了面向资源受限 LLM 的工具导向强化学习:(1) 动态多轮硬采样,不断用高质量 few-shot 示例(在 10 次 rollout 中未生成正确输出的样本)替换具有挑战性的样本,同时采用指数学习率衰减策略以缓解振荡;(2) 自举式思考(Self-Exemplifying Thinking),一种增强版 GRPO 框架,消除 KL 散度并调整裁剪系数,鼓励模型自主生成和分析 few-shot 示例,仅通过额外增加 0.01 的奖励即可实现。实验结果表明,ToolExpander 在提升 LLM 的工具使用能力方面取得显著成效,尤其是在较弱的小型模型上,显著改善了训练稳定性和整体性能。
关键词
引用
@article{arxiv.2510.07737,
title = {ToolExpander: Extending the Frontiers of Tool-Using Reinforcement Learning to Weak LLMs},
author = {Fu Chen and Peng Wang and Xiyin Li and Wen Li and Shichi Lei and Dongdong Xiang},
journal= {arXiv preprint arXiv:2510.07737},
year = {2025}
}