中文

基于无上下文强化学习的大语言模型工具使用

人工智能 2026-03-10 v1

摘要

虽然大型语言模型(LLMs)表现出强大的推理能力,但在复杂任务上的性能往往受限于其内部知识的局限性。通过与外部工具(如用于数学计算的Python解释器或用于检索事实信息的搜索引擎)扩展这些模型是一个克服这一挑战的有力方法。然而,有效启用模型使用这些工具仍是一个重大挑战。现有方法通常依赖于以监督微调(SFT)开头,随后进行强化学习(RL)的冷启动管道。这些方法通常需要大量用于SFT的标记数据,而标注或综合这些数据往往昂贵。本文提出了无上下文强化学习(ICRL),一种仅使用RL的框架,通过在RL rollout阶段利用零样本提示来消除对SFT的需求。具体而言,ICRL在rollout提示中引入无上下文示例,以教会模型如何调用外部工具。此外,随着训练的进行,无上下文示例的数量会逐渐减少,最终到达零样本设置,使模型能够独立调用工具。我们在广泛的推理和工具使用基准测试上进行了大量实验。结果表明,ICRL实现了最先进的性能,证明其作为一种可扩展、数据高效的SFT管道备选方案的有效性。

关键词

引用

@article{arxiv.2603.08068,
  title  = {In-Context Reinforcement Learning for Tool Use in Large Language Models},
  author = {Yaoqi Ye and Yiran Zhao and Keyu Duan and Zeyu Zheng and Kenji Kawaguchi and Cihang Xie and Michael Qizhe Shieh},
  journal= {arXiv preprint arXiv:2603.08068},
  year   = {2026}
}