引导并非超参数:扩散语言模型中的动态控制学习
计算与语言
2026-05-11 v1
摘要
分类器自由引导(CFG)是控制基于扩散的生成模型广泛使用的机制,但其引导尺度通常被视为生成过程中固定的超参数。这种静态设计导致可控性和质量之间的次优权衡,因为最佳引导程度会因任务不同以及扩散过程在不同阶段而变化,尤其在自然语言处理领域尤为如此。我们将CFG尺度选择重新建模为顺序决策问题,提出通过强化学习学习动态引导轨迹。具体而言,我们将引导尺度建模为在扩散状态演化时根据每个生成步骤选择的离散控制动作,并基于任务级奖励使用近端策略优化(PPO)优化策略。在三个受控NLP生成任务上使用离散扩散语言模型的实验表明,自适应引导始终比固定尺度策略在可控性和生成质量之间取得更好平衡。进一步分析学习到的策略,揭示了不同任务中引导轨迹具有_distinct且可解释的特征,凸显了将引导视为动态控制过程而非静态设计选择的重要性。
引用
@article{arxiv.2605.07701,
title = {Guidance Is Not a Hyperparameter: Learning Dynamic Control in Diffusion Language Models},
author = {Fan Zhou and Tim Van de Cruys},
journal= {arXiv preprint arXiv:2605.07701},
year = {2026}
}
备注
ReALM-GEN@ICLR2026