超越标记级策略梯度:大语言模型复杂推理
计算与语言
2026-02-17 v1
摘要
现有的自回归语言模型策略梯度方法通常将后续标记逐个选取作为策略中的动作。虽然对许多生成任务有效,但这种方法可能无法完全捕捉复杂推理任务的结构,在这些任务中,单个语义决策往往跨越多个标记——例如,在定义变量或组合方程时。这导致了标记级优化与这些情境下本质上块级推理之间的潜在不匹配。为弥合这一差距,我们提出了多标记策略梯度优化(MPO),将连续 K 个标记视为统一的语义动作。这种块级视角使我们能够捕捉推理轨迹的组合结构,并支持对连贯的高层次目标进行优化。在数学推理和编码基准测试中实验表明,MPO 在超越标准标记级策略梯度基线方面表现更佳,凸显了标记级策略梯度在复杂推理任务中的局限性,激励未来研究超越标记级粒度,专注于推理密集型语言任务。
引用
@article{arxiv.2602.14386,
title = {Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models},
author = {Mufan Xu and Kehai Chen and Xuefeng Bai and Zhengyu Niu and Muyun Yang and Tiejun Zhao and Min Zhang},
journal= {arXiv preprint arXiv:2602.14386},
year = {2026}
}