中文

Psi-Sampler:基于 SMC 的分数模型推理时奖励对齐的初始粒子采样

机器学习 2025-10-28 v3 人工智能 计算机视觉与模式识别

摘要

我们引入了 Ψ\Psi-Sampler,一个基于 SMC 的框架,结合基于 pCNL 的初始粒子采样,以实现与基于分数的生成模型的有效推理时奖励对齐。在从预训练到后训练优化的更广泛范式转变下,基于分数的生成模型的推理时奖励对齐近期获得了显著关注。这一趋势的核心是将序贯蒙特卡洛应用于去噪过程。然而,现有方法通常从高斯先验初始化粒子,这无法充分捕获与奖励相关的区域,导致采样效率降低。我们证明,从奖励感知后验进行初始化可显著提升对齐性能。为了在高维潜在空间中实现后验采样,我们引入了预条件 Crank-Nicolson Langevin(pCNL)算法,该算法将维度鲁棒的提议与梯度信息驱动的动力学相结合。如我们的实验所示,这种方法实现了高效且可扩展的后验采样,并在各种奖励对齐任务中持续提升性能,包括布局到图像生成、数量感知生成和美学偏好生成。项目网页:https://psi-sampler.github.io/

关键词

引用

@article{arxiv.2506.01320,
  title  = {Psi-Sampler: Initial Particle Sampling for SMC-Based Inference-Time Reward Alignment in Score Models},
  author = {Taehoon Yoon and Yunhong Min and Kyeongmin Yeo and Minhyuk Sung},
  journal= {arXiv preprint arXiv:2506.01320},
  year   = {2025}
}

备注

NeurIPS 2025, Spotlight Presentation