中文

基于 Doob $h$-变换的扩散模型训练免适应

机器学习 2026-02-19 v1

摘要

适应方法一直是解锁预训练扩散模型在各类应用中 transformative 能力的关键武器。现有方法常将适应目标抽象为奖励函数,引导扩散模型生成高奖励样本。然而,这些方法因额外训练导致高计算开销,或依赖奖励函数的严格可微性假设。此外,尽管其经验成功甚少有理论依据和保证。在本文中,我们提出 DOIT (Doob-Oriented Inference-time Transformation),一种无需训练且计算效率高的适应方法,适用于通用且非可微奖励。其核心框架是 measure transport 表述,旨在将预训练生成分布输送至高奖励目标分布。我们利用 Doob's hh-transform 实现该输送,这会在扩散采样过程中引入动态校正,使无需修改预训练模型即可进行高效基于仿真的计算。理论上,我们通过刻画动态 Doob 校正的近似误差,建立了对目标高奖励分布的高概率收敛保证。经验上,在 D4RL offline RL 基准测试上,我们的方法持续优于最先进的基线,同时保持采样效率。

关键词

引用

@article{arxiv.2602.16198,
  title  = {Training-Free Adaptation of Diffusion Models via Doob's $h$-Transform},
  author = {Qijie Zhu and Zeqi Ye and Han Liu and Zhaoran Wang and Minshuo Chen},
  journal= {arXiv preprint arXiv:2602.16198},
  year   = {2026}
}

备注

36 pages, 3 figures