SPG: 用于掩码扩散语言模型的夹心策略梯度
计算与语言
2026-04-16 v3 人工智能
摘要
扩散大语言模型(dLLMs)正作为自回归模型的高效替代方案出现,因其能够并行解码多个token。然而,通过强化学习(RL)将dLLMs与人类偏好或任务特定奖励对齐具有挑战性,因为其不可处理的似然对数排除了标准策略梯度方法的直接应用。虽然先前工作使用证据下界(ELBO)等代理,但这些单边近似可能引入显著的策略梯度偏差。为解决此问题,我们提出夹心策略梯度(SPG),利用真实似然对数的上界和下界。实验表明,SPG显著优于基于ELBO或一步估计的基线。具体而言,SPG在dLLMs的RL方法中,将GSM8K准确率提升3.6%,MATH500提升2.6%,Countdown提升18.4%,Sudoku提升27.0%。
引用
@article{arxiv.2510.09541,
title = {SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models},
author = {Chenyu Wang and Paria Rashidinejad and DiJia Su and Song Jiang and Sid Wang and Siyan Zhao and Cai Zhou and Shannon Zejiang Shen and Feiyu Chen and Tommi Jaakkola and Yuandong Tian and Bo Liu},
journal= {arXiv preprint arXiv:2510.09541},
year = {2026}
}
备注
ICLR 2026