基于迭代奖励校准的多轮工具调用强化学习
人工智能
2026-04-06 v1
摘要
在多轮任务上进行工具调用智能体的强化学习训练仍具有挑战性,主要由于稀疏结果奖励以及跨对话轮次的信用分配困难。我们首次将MT-GRPO(Multi-Turn Group Relative Policy Optimization)与GTPO(Generalized Token-level Policy Optimization)结合,用于训练应用于真实客户服务任务的工具调用智能体,采用基于LLM的用户模拟器。通过对训练 rollout的系统性分析,我们发现过于紧凑的每轮奖励设计会因奖励可区分性与优势方向之间的错位,导致性能下降最高可达14个百分点。我们引入迭代奖励校准,一种用于设计每轮奖励的方法,利用 rollout数据中的经验判别分析,并表明我们的GTPO混合优势公式消除了优势错位问题。应用于Tau-Bench航空基准测试,我们的方法将Qwen3.5-4B模型从63.8%提升至66.7%(+2.9pp),将Qwen3-30B-A3B从58.0%提升至69.5%(+11.5pp),训练好的4B模型甚至超过GPT-4.1(49.4%)和GPT-4o(42.8%),尽管其规模仅为其1/50,30.5B的Mixture-of-Experts模型接近Claude Sonnet 4.5(70.0%)。到我们知识,这些是Tau-Bench上首个发布的RL训练结果。我们发布代码、奖励校准分析以及训练配方。
引用
@article{arxiv.2604.02869,
title = {Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration},
author = {Wachiravit Modecrua and Krittanon Kaewtawee and Krittin Pachtrachai and Touchapon Kraisingkorn},
journal= {arXiv preprint arXiv:2604.02869},
year = {2026}
}