GTPO 与 GRPO-S:基于策略熵的时间和序列级奖励塑形
计算与语言
2026-02-06 v6 人工智能
摘要
强化学习(RL)是增强大型语言模型(LLM)推理能力的关键方法,但主流算法如 GRPO 和 DAPO 仍受限于粗粒度信用分配范式,即同一响应中所有 token 获得相同的奖励。本文提出了动态熵权重方法,系统定义熵比 及其变体,用于重新分配奖励并通过两种新算法获得细粒度奖励:组令策略优化(GTPO),为每个 token 分配熵加权奖励并合成 token 特定的优势函数以驱动模型趋向最优路径;以及类似的序列级 GRPO(GRPO-S),将该设计扩展到序列层面,在长链式思考(CoT)推理任务中表现出更好的稳定性。
引用
@article{arxiv.2508.04349,
title = {GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy},
author = {Hongze Tan and Zihan Wang and Jianfei Pan and Jinghao Lin and Hao Wang and Yifan Wu and Tao Chen and Zhihang Zheng and Zhihao Tang and Haihua Yang},
journal= {arXiv preprint arXiv:2508.04349},
year = {2026}
}