中文

隐藏状态知道推理何处分歧:基于跨度级 Wasserstein 距离的信用分配

计算与语言 2026-04-28 v1 机器学习

摘要

Group Relative Policy Optimization(GRPO)通过为 rollout 中的所有 token 分配相同的 advantage 来对强化学习中的可验证奖励(RLVR)进行粗粒度信用分配。过程奖励模型可提供更细粒度的监督,但需要逐步级别注释或额外的奖励建模。我们展示,隐藏状态分布包含可从局部推理质量中提取的有用信号,这一信号可仅使用 RLVR 中可用的 outcome-level 正确性标签提取。具体而言,在每个 GRPO 组内,正确 rollout 和错误 rollout 的跨度级隐藏状态分布之间的 Wasserstein 距离在其局部推理质量分歧的区域处增加。这一关联在跨示例以及单个轨迹内都成立,表明隐藏状态分布的差异可作为细粒度信用分配的自监督信号。我们通过在结构性假设下 formalizing 此观察,用分离定理表明:在 population-level 分布差异超过有限样本噪声时,post-divergence spans 的 Wasserstein 距离大于 pre-divergence spans。鼓励此结果,我们提出了 Span-level Hidden state Enabled Advantage Reweighting(SHEAR),该方法修改 GRPO,通过使用跨度级 Wasserstein 距离来缩放 token 级别的 advantage,从而放大那些隐藏状态与对方组更分离的 token 的更新。该方法无需额外模型,仅需对训练管道进行最小修改。在五个数学推理基准和五个代码生成基准上的实验显示,相对于标准 GRPO 和强大的监督过程奖励模型,SHEAR 在性能上取得改进,同时无需额外注释或奖励模型训练。

关键词

引用

@article{arxiv.2604.23318,
  title  = {Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance},
  author = {Xinzhu Chen and Wei He and Huichuan Fan and Wenzhe Niu and Zhongxiang Sun and Xuanru Wang and Jiuchong Gao and Jinghua Hao and Renqing He and Weijie Yu},
  journal= {arXiv preprint arXiv:2604.23318},
  year   = {2026}
}