中文

面向生成模型中奖励对齐的无梯度噪声优化

机器学习 2026-05-14 v2 人工智能 计算机视觉与模式识别

摘要

现有的针对扩散和流模型的奖励对齐方法依赖于多步随机轨迹,这使得它们难以扩展到确定性生成器。一种自然的替代方案是噪声空间优化,但现有方法需要通过生成器和奖励管道进行反向传播,限制了其在可微分设置中的适用性。为了解决这个问题,我们在此提出ZeNO(零阶噪声优化),一个无梯度框架,它将噪声优化公式化为一个路径积分控制问题,仅通过零阶奖励评估即可估计。当使用奥恩斯坦-乌伦贝克参考过程实例化时,其更新与隐式地瞄准奖励倾斜分布的朗之万动力学相联系。ZeNO实现了有效的推理时扩展,并在包括一个反向传播不可行的蛋白质结构生成任务在内的多种生成器和奖励函数上展示了强大的性能。

关键词

引用

@article{arxiv.2605.11347,
  title  = {Gradient-Free Noise Optimization for Reward Alignment in Generative Models},
  author = {Jeongsol Kim and Hongeun Kim and Jian Wang and Jong Chul Ye},
  journal= {arXiv preprint arXiv:2605.11347},
  year   = {2026}
}