VASR:基于方差感知的系统性抽样用于奖励引导的扩散模型
人工智能
2026-05-13 v2
摘要
针对奖励引导的扩散模型,序列蒙特卡洛(SMC)采样器常常 suffer 于快速的血统崩溃:在仅仅数次抽样步骤后,少数高奖励粒子主导整个种群,导致多样性丧失并降低样本质量。我们提出了一种基于方差分解框架的奖励引导扩散 SMC 方法,将继续方差 与残差方差 分离,从而揭示了在常用多项抽样下,高后代数量方差正是推动这种崩溃的根本原因。这激励我们提出了 \textsc{VASR}(Variance-Aware Systematic Resampling),通过方差最优质量分配 (最小化 )和系统抽样(控制 )来解决这两种方差。对于中间奖励因随机继续导致噪声的潜在扩散模型,我们提出了 \textsc{VASR-Max},即一个刻意偏向的高选择变体,用于方差敏感的奖励优化。两种方法均为训练-free、全并行,且仅增加线性开销。在 MNIST 和 CIFAR-10 上,VASR 可实现最高达 的 FID 提升,同时在匹配计算资源时,速度是基于 MCTS 的价值方法的 倍。在文本到图像生成中,\textsc{VASR-Max} 在不同计算预算下均优于最强的 SMC 基线方法,并在高预算下以仅 -- 的奖励差距匹配基于 MCTS 的方法,同时快 approximately 倍。
引用
@article{arxiv.2604.06779,
title = {VASR: Variance-Aware Systematic Resampling for Reward-Guided Diffusion},
author = {Shivanshu Shekhar and Sagnik Mukherjee and Jia Yi Zhang and Tong Zhang},
journal= {arXiv preprint arXiv:2604.06779},
year = {2026}
}