基于马尔可夫似然的标记级策略优化:将组级奖励关联至标记级聚合
计算与语言
2025-10-13 v1
摘要
组相对策略优化(GRPO)已显著提升了大语言模型(LLMs)的推理能力,尤其是提升了其数学性能。然而,GRPO 和相关的熵正则化方法仍面临链路思维(CoT)中稀疏标记奖励所固有的挑战。当前方法常依赖非细化的标记级熵调整,导致熵坍缩或模型坍缩。本文提出 TEPO,一种新型标记级框架,引入马尔可夫似然(序列似然)将组级奖励通过标记级聚合与标记关联。实验表明,TEPO 在关键指标(包括 @k 和准确率)上 consistently 优于现有基线。它不仅在数学推理任务上树立了新的最佳成绩,还显著提升了训练稳定性。
引用
@article{arxiv.2510.09369,
title = {Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood},
author = {Xingyu Lin and Yilin Wen and En Wang and Du Su and Wenbin Liu and Chenfu Bao and Zhonghou Lv},
journal= {arXiv preprint arXiv:2510.09369},
year = {2025}
}