中文

面向扩散模型测试时扩展的前瞻样本奖励引导

机器学习 2026-02-04 v1 人工智能

摘要

扩散模型已展示出强大的生成性能;然而,生成的样本往往未能完全对齐人类意图。本文研究了一种测试时扩展方法,使能够从具有更高人类对齐奖励值的区域进行采样。现有梯度引导方法使用泰勒近似在中间粒子 xt\mathbf{x}_t 处近似期望未来奖励(EFR),但该近似在每个时间步骤上都因顺序神经反向传播而导致高计算成本。我们表明,xt\mathbf{x}_t 处的EFR可仅通过来自预训练扩散模型的边际样本来计算。提出的EFR公式将神经依赖从xt\mathbf{x}_t 与EFR之间分离,实现无需神经反向传播的闭形式引导计算。为进一步提高效率,我们引入前瞻采样以收集边际样本。最终样本生成,我们使用准确求解器将粒子引导 toward high-reward lookahead samples。我们将这种采样方案称为LiDAR采样。LiDAR仅需三个样本配合3步前瞻求解器,即可实现显著的性能提升;随着前瞻精度和样本数量的增加,性能提升呈显著趋势;值得注意的是,它以9.5倍加速达到与最新梯度引导方法相同SDXL的GenEval性能。

关键词

引用

@article{arxiv.2602.03211,
  title  = {Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models},
  author = {Yeongmin Kim and Donghyeok Shin and Byeonghu Na and Minsang Park and Richard Lee Kim and Il-Chul Moon},
  journal= {arXiv preprint arXiv:2602.03211},
  year   = {2026}
}

备注

Under Review