RFG:扩散大语言模型推理的无奖励引导测试时扩展
计算与语言
2025-10-01 v1 机器学习
摘要
扩散大语言模型(dLLMs)在大规模语言建模方面展现出巨大潜力,并且越来越有兴趣通过逐步引导推理过程来进一步提升解决复杂问题的能力。自回归语言模型的常见做法通常通过密集标注每个中间步骤来学习过程奖励模型。然而,这对 dLLMs 来说具有挑战性,因为其生成是任意顺序的,且中间状态是部分被遮蔽的句子。为此,在本论文中,我们提出无奖励引导(RFG),一种在无显式过程奖励的情况下引导 dLLMs 推理轨迹的原则性方法。RFG 的核心思想是通过增强 dLLM 与参考 dLLM 的对数似然比来参数化过程奖励,其中增强模型可以通过任何经过强化学习(RL)或监督微调(SFT)后训练的现成 dLLM 轻松获得。我们提供了理论证明,表明 RFG 在无额外奖励的情况下诱导奖励引导采样分布。我们在四个具有挑战性的数学推理和代码生成基准上,使用经过多种后训练方法增强的多样化 dLLM 进行了全面实验。RFG 在所有任务和模型类型上持续产生显著提升,准确率提升高达 9.2%。这些发现确立了 RFG 作为一个通用训练无关框架,可以在不依赖外部奖励模型的情况下扩展测试时推理。
引用
@article{arxiv.2509.25604,
title = {RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance},
author = {Tianlang Chen and Minkai Xu and Jure Leskovec and Stefano Ermon},
journal= {arXiv preprint arXiv:2509.25604},
year = {2025}
}
备注
27 pages, 3 figures, 2 tables