MDPO:克服掩码扩散语言模型训练-推理鸿沟
机器学习
2025-09-26 v2
摘要
扩散语言模型作为传统自回归模型的有前景的替代方案,能够实现更快的生成速度和对双向上下文的更丰富的条件化。然而,它们存在训练与推理之间的关键差异:在推理期间,MDLM逐步通过产生更少的被掩码标记来逐步揭示生成序列的结构,而在训练期间,由于标记被随机掩码,此结构被忽略。尽管这种训练-推理之间的差异可能导致次优性能,但它在以往工作中基本被忽视,使得在两个阶段之间缩小这一差距仍是一个开放问题。为此,我们将有效去噪轨迹的学习问题定义为顺序决策问题,并利用所得框架应用强化学习。我们提出了一种新颖的掩码扩散策略优化(MDPO),以利用扩散所具备的马尔可夫性质,显式地在推理时使用的渐进式细化计划下训练模型。MDPO在60倍更少的梯度更新次数下,匹配了之前的最先进(SOTA)方法的性能;在相同数量的权重更新次数内,平均在MATH500上提升9.6%,在Countdown上提升54.2%。此外,我们改进了MDLM的重掩码策略,作为一种插式推理替换,以克服模型无法灵活细化标记的局限性。这种训练-free方法,称为运行置信度重掩码(RCR),持续地提高了性能,并在使用MDPO时提供了进一步的改进。我们的发现为调查MDLM预训练与推理之间的差异开辟了广阔的潜力。代码:https://github.com/autonomousvision/mdpo。项目页面:https://cli212.github.io/MDPO/。
引用
@article{arxiv.2508.13148,
title = {MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models},
author = {Haoyu He and Katrin Renz and Yong Cao and Andreas Geiger},
journal= {arXiv preprint arXiv:2508.13148},
year = {2025}
}