中文

使用强化学习提升SLM的工具使用能力

计算与语言 2025-09-10 v2

摘要

在工具增强AI智能体变得日益重要的时代,我们的研究结果凸显了组相对策略优化(GRPO)赋能SLM的能力,而这些模型在工具使用方面传统上受到限制。有效使用工具已成为大型语言模型(LLM)的一个决定性特征,使其能够访问外部数据和内部资源。随着AI智能体变得越来越复杂,工具使用能力已变得不可或缺。尽管LLM在该领域取得了重大进展,但小型语言模型(SLM)在准确整合工具使用方面仍面临挑战,尤其是在资源受限的环境中。本研究探讨了强化学习,特别是组相对策略优化(GRPO),如何提升SLM的工具使用准确性。通过设计一个明确的奖励系统来强化结构化JSON输出、正确的工具选择和精确的参数使用,我们证明了GRPO使SLM在工具使用能力(函数调用/JSON输出)上取得了显著提升。我们的方法提供了一种计算高效的训练方法,增强了SLM在实际AI应用中的实际部署。

关键词

引用

@article{arxiv.2509.04518,
  title  = {Advancing SLM Tool-Use Capability using Reinforcement Learning},
  author = {Dhruvi Paprunia and Vansh Kharidia and Pankti Doshi},
  journal= {arXiv preprint arXiv:2509.04518},
  year   = {2025}
}