针对扩散语言模型中的强化学习提出去噪感知信用分配(DACA-GRPO)
机器学习
2026-05-19 v1 人工智能
计算与语言
摘要
扩散大型语言模型是自回归模型的有力替代方案,但现有针对扩散模型的 RL 方法将所有去噪步骤视为 equally important,并依赖偏差大、方差高的似然估计。我们识别出两个根本性弱点:缺乏跨去噪轨迹的时间信用分配,以及用于策略优化的均场似然估计存在系统性偏差。为此,我们提出 Denoising-Aware Credit Assignment for GRPO(DACA-GRPO),这是一种轻量级、即插即用的 GRPO 风格训练器增强方案。DACA-GRPO 引入两种互补机制:去噪进度得分(Denoising Progress Scores),从中间预测中提取每个标记的重要性权重且无需额外前向计算;以及分层掩码似然(Stratified Masking Likelihood),将标记位置划分为层次结构,使每个标记都以序列大部分为上下文进行预测,从而降低均场偏差。在三个 GRPO 基础方法之上应用时,DACA-GRPO 在覆盖数学推理、代码生成、约束满足和受约束生成等七个基准测试中实现了一致的改进,分别在数学推理、代码生成、约束满足和 JSON 模式遵循方面的提升分别可达到 5.6 百分点、7.4 百分点、36.3 百分点和 5.9 百分点。
引用
@article{arxiv.2605.16342,
title = {DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models},
author = {Amin Karimi Monsefi and Dominic Culver and Nikhil Bhendawade and Lokesh Boominathan and Manuel R. Ciosici and Yizhe Zhang and Irina Belousova},
journal= {arXiv preprint arXiv:2605.16342},
year = {2026}
}