中文

AWPO:通过自适应整合推理奖励增强大语言模型工具使用

计算与语言 2026-01-16 v3

摘要

虽然强化学习(RL)在使用可验证结果奖励训练工具使用型大语言模型(LLM)方面显示出前景,但现有方法基本上忽视了基于链式思维质量的推理奖励以更好地利用工具的潜力。此外,单纯组合推理奖励和结果奖励可能导致次优性能或与主要优化目标冲突。为此,我们提出Advantage-Weighted Policy Optimization(AWPO),一种原则性的RL框架,自适应地将推理奖励整合到优势估计中以提高工具使用性能。AWPO包含变异感知门控和难度感知加权,以根据组相对统计数据自适应调制来自推理信号的优势,同时针对稳定优化提出了量身定制的裁剪机制。广泛的实验表明,AWPO在标准工具使用基准测试中实现了最前沿的性能,显著优于强大的基线模型,在具有挑战性的多轮场景中超过了闭源模型。值得注意的是,凭借卓越的参数效率,我们的4B模型在多轮准确率上超过Grok-4的16.0%,同时保持了在分布外MMLU-Pro基准测试上的泛化能力。

关键词

引用

@article{arxiv.2512.19126,
  title  = {AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards},
  author = {Zihan Lin and Xiaohan Wang and Hexiong Yang and Jiajun Chai and Jie Cao and Guojun Yin and Wei Lin and Ran He},
  journal= {arXiv preprint arXiv:2512.19126},
  year   = {2026}
}