中文

VASR:基于方差感知的系统性抽样用于奖励引导的扩散模型

人工智能 2026-05-13 v2

摘要

针对奖励引导的扩散模型,序列蒙特卡洛(SMC)采样器常常 suffer 于快速的血统崩溃:在仅仅数次抽样步骤后,少数高奖励粒子主导整个种群,导致多样性丧失并降低样本质量。我们提出了一种基于方差分解框架的奖励引导扩散 SMC 方法,将继续方差 VtcontV_t^{\mathrm{cont}} 与残差方差 VtresV_t^{\mathrm{res}} 分离,从而揭示了在常用多项抽样下,高后代数量方差正是推动这种崩溃的根本原因。这激励我们提出了 \textsc{VASR}(Variance-Aware Systematic Resampling),通过方差最优质量分配 mtwtertm_t \propto w_t e^{r_t}(最小化 VtcontV_t^{\mathrm{cont}})和系统抽样(控制 VtresV_t^{\mathrm{res}})来解决这两种方差。对于中间奖励因随机继续导致噪声的潜在扩散模型,我们提出了 \textsc{VASR-Max},即一个刻意偏向的高选择变体,用于方差敏感的奖励优化。两种方法均为训练-free、全并行,且仅增加线性开销。在 MNIST 和 CIFAR-10 上,VASR 可实现最高达 26%26\% 的 FID 提升,同时在匹配计算资源时,速度是基于 MCTS 的价值方法的 6666 倍。在文本到图像生成中,\textsc{VASR-Max} 在不同计算预算下均优于最强的 SMC 基线方法,并在高预算下以仅 2.52.5--3%3\% 的奖励差距匹配基于 MCTS 的方法,同时快 approximately 倍。

关键词

引用

@article{arxiv.2604.06779,
  title  = {VASR: Variance-Aware Systematic Resampling for Reward-Guided Diffusion},
  author = {Shivanshu Shekhar and Sagnik Mukherjee and Jia Yi Zhang and Tong Zhang},
  journal= {arXiv preprint arXiv:2604.06779},
  year   = {2026}
}