中文

GTPO 与 GRPO-S:基于策略熵的时间和序列级奖励塑形

计算与语言 2026-02-06 v6 人工智能

摘要

强化学习(RL)是增强大型语言模型(LLM)推理能力的关键方法,但主流算法如 GRPO 和 DAPO 仍受限于粗粒度信用分配范式,即同一响应中所有 token 获得相同的奖励。本文提出了动态熵权重方法,系统定义熵比 Hi,tk=1nHk,t\frac{H_{i,t}}{\sum_{k=1}^{n} H_{k,t}} 及其变体,用于重新分配奖励并通过两种新算法获得细粒度奖励:组令策略优化(GTPO),为每个 token 分配熵加权奖励并合成 token 特定的优势函数以驱动模型趋向最优路径;以及类似的序列级 GRPO(GRPO-S),将该设计扩展到序列层面,在长链式思考(CoT)推理任务中表现出更好的稳定性。

关键词

引用

@article{arxiv.2508.04349,
  title  = {GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy},
  author = {Hongze Tan and Zihan Wang and Jianfei Pan and Jinghao Lin and Hao Wang and Yifan Wu and Tao Chen and Zhihang Zheng and Zhihao Tang and Haihua Yang},
  journal= {arXiv preprint arXiv:2508.04349},
  year   = {2026}
}