无条件先验至关重要!提高微调扩散模型的条件生成质量
计算机视觉与模式识别
2026-02-11 v3
摘要
分类无条件引导(CFG)是训练条件扩散模型的基本技术。当前CFG训练的常规做法是使用单个网络学习无条件与条件噪声预测,条件 Dropout 率较小。然而,我们注意到,在训练中对无条件噪声的联合学习带有有限带宽,导致对无条件情况的先验质量较差。更重要的是,这些较差的无条件噪声预测成为降低条件生成质量的严重原因。受大多数CFG条件模型通过微调底部模型以获得更好无条件生成的启发,我们首先展示,仅用底部模型预测的无条件噪声替换CFG中的无条件噪声即可显著提高条件生成。进一步地,我们表明可用于无条件噪声替换的扩散模型无需是微调模型所训练的模型。我们通过实验验证了这一主张,对包括 Zero-1-to-3、Versatile Diffusion、DiT、DynamiCrafter 和 InstructPix2Pix 在内的多种CFG条件模型进行了图像和视频生成。
引用
@article{arxiv.2503.20240,
title = {Unconditional Priors Matter! Improving Conditional Generation of Fine-Tuned Diffusion Models},
author = {Prin Phunyaphibarn and Phillip Y. Lee and Jaihoon Kim and Minhyuk Sung},
journal= {arXiv preprint arXiv:2503.20240},
year = {2026}
}
备注
WACV 2026; Project Page: https://unconditional-priors-matter.github.io/