中文

通过 Fission-GRPO 实现鲁棒的工具使用:学习从执行错误中恢复

机器学习 2026-04-21 v2 人工智能

摘要

大语言模型(LLMs)能够有效地调用工具,但在多轮执行中仍然脆弱:在工具调用错误后,较小的模型常常陷入重复的无效重新调用,而不是解释反馈并恢复。这种失败模式之所以持续存在,是因为当前的训练范式没有明确教导模型如何从执行错误中恢复。具体而言,标准强化学习(RL)将丰富的失败经验压缩为稀疏的负奖励,而预先收集的纠错数据集则与策略不断演变的失败模式不匹配。为了弥合这一差距,我们提出了 Fission-GRPO,一个在 RL 训练循环内将执行错误转化为在策略纠正监督的框架。我们的核心机制通过用来自微调错误模拟器的诊断反馈增强每条失败轨迹,将其裂变为一个新的训练实例,然后在策略上重采样多个恢复展开。这使模型能够从其在探索期间所犯的确切错误中学习,而不是从静态的、预先收集的错误案例中学习。在 BFCL v4 Multi-Turn 上,Fission-GRPO 将 Qwen3-8B 的错误恢复率绝对提高了 5.7%,总体准确率提高了 4.0%(从 42.75% 提高到 46.75%),优于 RL 基线和专用工具使用智能体。该方法进一步泛化到 TAU-Bench 和 TAU2-Bench,在大多数设置中取得了领先结果,提升高达 +17.4%。

关键词

引用

@article{arxiv.2601.15625,
  title  = {Robust Tool Use via Fission-GRPO: Learning to Recover from Execution Errors},
  author = {Zhiwei Zhang and Fei Zhao and Rui Wang and Zezhong Wang and Bin Liang and Jiakang Wang and Yao Hu and Shaosheng Cao and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2601.15625},
  year   = {2026}
}

备注

9 pages, 4 figures, 4 tables. Accepted to ACL 2026 Main Conference