中文

Neighbor GRPO:对比 ODE 策略优化用于对齐流模型

计算机视觉与模式识别 2026-03-19 v2 机器学习 图像与视频处理

摘要

组相对策略优化 (GRPO) 在对齐图像和视频生成模型与人类偏好方面显示出前景。然而,将其应用于现代流匹配模型具有挑战,因为其确定性采样范式。当前方法通过将普通微分方程 (ODE) 转换为随机微分方程 (SDE) 来解决此问题,这引入了随机性。然而,这种基于 SDE 的 GRPO 存在信用分配效率低和与高阶求解器不兼容的问题(用于更少的采样步骤)。本文首先从距离优化视角重新解释现有的基于 SDE 的 GRPO 方法,揭示其作为对比学习形式的底层机制。基于此洞察,我们提出了 Neighbor GRPO,这是一种完全绕过无需 SDE 的新型对齐算法。Neighbor GRPO 通过扰动 ODE 的初始噪声条件生成一组多样化的候选轨迹,并使用基于 softmax 距离的代理跳跃策略对模型进行优化。我们在理论上建立了该距离基于目标与策略梯度优化之间的联系,严格地将我们的 метод整合到 GRPO 框架中。我们的方法完全保留了确定性 ODE 采样的优势,包括效率和与高阶求解器的兼容性。我们进一步引入对称锚点采样以提高计算效率,并引入组间准规范重加权以解决奖励平坦问题。广泛的实验表明,Neighbor GRPO 在训练成本、收敛速度和生成质量方面显著优于基于 SDE 的方法。

关键词

引用

@article{arxiv.2511.16955,
  title  = {Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models},
  author = {Dailan He and Guanlin Feng and Xingtong Ge and Yazhe Niu and Yi Zhang and Bingqi Ma and Guanglu Song and Yu Liu and Hongsheng Li},
  journal= {arXiv preprint arXiv:2511.16955},
  year   = {2026}
}

备注

CVPR 2026