中文

用于高效可靠奖励引导生成的梯度预处理

机器学习 2026-05-29 v2

摘要

我们提出了一种梯度预处理方法,使得使用单步生成模型进行奖励引导生成既高效又可靠。测试时噪声优化可以从预训练生成模型中解锁显著更好的奖励引导生成,但它容易导致降低质量的奖励破解,并且通常因速度太慢而无法实际使用。我们通过将奖励梯度投影到一个精心设计的白高斯噪声可行集上来预处理它们,该可行集是一个具有分块范数约束的紧凑谱集,能够紧密捕捉白高斯噪声的统计特性和空间不相关性。这种预处理将每次梯度更新重塑为与噪声对齐的方向,驱动更快、更有效的奖励上升,同时防止奖励破解。该投影具有闭式解,其复杂度与FFT的O(NlogN)O(N \log N)相匹配,在实践中增加了可忽略的开销。在使用FLUX和四个奖励模型的实验中,我们的方法仅使用最先进的基于正则化的方法所需挂钟时间的30%就达到了可比的审美分数(Aesthetic Score)。

关键词

引用

@article{arxiv.2602.08646,
  title  = {Gradient Preconditioning for Efficient and Reliable Reward-Guided Generation},
  author = {Jisung Hwang and Minhyuk Sung},
  journal= {arXiv preprint arXiv:2602.08646},
  year   = {2026}
}

备注

ICML 2026