中文

KTAE:用于数学推理中的关键令牌优势估计的无模型算法

人工智能 2025-11-18 v2 计算与语言

摘要

最近的进展表明,整合强化学习与基于规则的奖励可显著提升大型语言模型的推理能力,即使无需监督微调。然而,流行的强化学习算法如 GRPO 及其变体 DAPO 等,在计算优势时存在粗粒度问题。具体而言,它们计算的为 rollout 级别的优势,为序列中每个标记分配相同的值,未能捕捉标记特定贡献,阻碍有效学习。为此,我们提出关键令牌优势估计(KTAE)——一种无需引入额外模型即可估计细粒度、标记级别优势的新型算法。KTAE 利用抽样 rollout 的正确性,并应用统计分析量化序列中 individual 标记对最终结果的重要性。该量化的标记级别重要性随后与 rollout 级别优势结合,以获得更细粒度的标记级别优势估计。实证结果表明,使用 GRPO+KTAE 和 DAPO+KTAE 训练的模型在五个数学推理基准测试中均优于基线方法。值得注意的是,它们在更短的响应下即可实现更高准确率,甚至在使用相同基础模型的情况下超越了 R1-Distill-Qwen-1.5B。

关键词

引用

@article{arxiv.2505.16826,
  title  = {KTAE: A Model-Free Algorithm to Key-Tokens Advantage Estimation in Mathematical Reasoning},
  author = {Wei Sun and Wen Yang and Pu Jian and Qianlong Du and Fuwei Cui and Shuo Ren and Jiajun Zhang},
  journal= {arXiv preprint arXiv:2505.16826},
  year   = {2025}
}

备注

NeurIPS 2025 Poster