中文

ResT:面向工具使用大语言模型的令牌级策略梯度重塑

计算与语言 2026-02-05 v2

摘要

大语言模型(LLMs)超越被动生成,通过调用外部工具充当目标导向的智能体。强化学习(RL)为优化这些新兴的工具使用策略提供了原则性框架,但当前主流范式完全依赖稀疏的结果奖励,且缺乏对工具使用任务特殊性的考量,导致策略梯度方差膨胀并造成训练效率低下。为更好地理解和应对这些挑战,我们首先建立了策略熵与工具使用任务训练稳定性之间的理论联系,揭示了结构化的低熵令牌是奖励的主要决定因素。受此启发,我们提出了面向工具使用任务的**Res**haped **T**oken-level policy gradients(**ResT**)。ResT通过基于熵的令牌重加权来重塑策略梯度,在训练过程中逐步提高推理令牌的权重。这种基于熵的方案能够在结构正确性与语义推理之间实现平滑过渡,并稳定多轮工具使用任务的收敛。在BFCL和API-Bank上的评估表明,ResT取得了最先进的结果,相比先前方法性能提升高达8.76%8.76\%。当在4B基础LLM上进行微调时,ResT在单轮任务上进一步超越GPT-4o 4.11%4.11\%,在多轮基础任务上超越1.50%1.50\%。代码可在https://github.com/1229095296/ResT_Tool_use_LLM.git获取。

关键词

引用

@article{arxiv.2509.21826,
  title  = {ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models},
  author = {Zihan Lin and Xiaohan Wang and Jie Cao and Jiajun Chai and Guojun Yin and Wei Lin and Ran He},
  journal= {arXiv preprint arXiv:2509.21826},
  year   = {2026}
}

备注

Accepted by ICLR2026