基于 Doob $h$-变换的扩散模型训练免适应
机器学习
2026-02-19 v1
摘要
适应方法一直是解锁预训练扩散模型在各类应用中 transformative 能力的关键武器。现有方法常将适应目标抽象为奖励函数,引导扩散模型生成高奖励样本。然而,这些方法因额外训练导致高计算开销,或依赖奖励函数的严格可微性假设。此外,尽管其经验成功甚少有理论依据和保证。在本文中,我们提出 DOIT (Doob-Oriented Inference-time Transformation),一种无需训练且计算效率高的适应方法,适用于通用且非可微奖励。其核心框架是 measure transport 表述,旨在将预训练生成分布输送至高奖励目标分布。我们利用 Doob's -transform 实现该输送,这会在扩散采样过程中引入动态校正,使无需修改预训练模型即可进行高效基于仿真的计算。理论上,我们通过刻画动态 Doob 校正的近似误差,建立了对目标高奖励分布的高概率收敛保证。经验上,在 D4RL offline RL 基准测试上,我们的方法持续优于最先进的基线,同时保持采样效率。
关键词
引用
@article{arxiv.2602.16198,
title = {Training-Free Adaptation of Diffusion Models via Doob's $h$-Transform},
author = {Qijie Zhu and Zeqi Ye and Han Liu and Zhaoran Wang and Minshuo Chen},
journal= {arXiv preprint arXiv:2602.16198},
year = {2026}
}
备注
36 pages, 3 figures