超越均等信用:基于因果信用分配的政策优化
计算与语言
2026-02-11 v1 人工智能
机器学习
摘要
策略梯度方法用于语言模型推理,如GRPO和DAPO,为所有生成的标记分配均等信用——填充短语"让我思考一下"接收与关键计算"23 + 45 = 68"相同的梯度更新。我们提出反事实重要性加权:遮蔽推理片段,测量答案概率的下降,并在策略梯度更新期间相应上调这些标记的权重。我们的方法无需辅助模型或外部标注,重要性直接从策略模型自身的概率变化中估计。实验在GSM8K数据集上进行,涵盖Qwen和Llama系列的三个模型,结果显示相对于均等基线持续改进,同时更快地收敛至等效准确率。对重要性信号取反会损害性能,这确认我们捕获的是真实的因果结构而非噪声。分析表明,该方法正确地优先考虑计算步骤而非脚手架文本。我们将这些发现视为进一步研究的基础,而非完整解决方案。
引用
@article{arxiv.2602.09331,
title = {Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization},
author = {Mykola Khandoga and Rui Yuan and Vinay Kumar Sankarapu},
journal= {arXiv preprint arXiv:2602.09331},
year = {2026}
}
备注
12 pages, 1 figure