中文

扩散模型的黄金噪声:一种学习框架

机器学习 2025-07-18 v5 计算机视觉与模式识别

摘要

文生图扩散模型是一种流行的范式,通过提供文本提示和随机高斯噪声来合成个性化图像。虽然人们观察到某些噪声是“黄金噪声”,能比其他噪声实现更好的文图对齐和更高的人类偏好,但我们仍缺乏一种机器学习框架来获取这些黄金噪声。为了学习用于扩散采样的黄金噪声,本文主要做出三项贡献。首先,我们提出了一个称为“噪声提示”的新概念,旨在通过添加源自文本提示的小的期望扰动,将随机高斯噪声转化为黄金噪声。基于这一概念,我们首先构建了“噪声提示学习”框架,系统地为扩散模型学习与文本提示相关联的“提示后”黄金噪声。其次,我们设计了一个噪声提示数据收集流程,收集了一个大规模的“噪声提示数据集”(NPD),包含 10 万对随机噪声和黄金噪声及其关联的文本提示。利用准备好的 NPD 作为训练数据集,我们训练了一个小型的“噪声提示网络”(NPNet),它可以直接学习将随机噪声转化为黄金噪声。学习到的黄金噪声扰动可以被视为一种噪声提示,因为它富含语义信息并针对给定的文本提示量身定制。第三,我们的大量实验证明了 NPNet 在提高各种扩散模型(包括 SDXL、DreamShaper-xl-v2-turbo 和 Hunyuan-DiT)合成图像质量方面的显著有效性和泛化能力。此外,NPNet 是一个小型高效的控制器,作为一个即插即用模块,仅提供黄金噪声而非随机噪声,无需访问原始流程,因此额外推理和计算成本极低。

关键词

引用

@article{arxiv.2411.09502,
  title  = {Golden Noise for Diffusion Models: A Learning Framework},
  author = {Zikai Zhou and Shitong Shao and Lichen Bai and Shufei Zhang and Zhiqiang Xu and Bo Han and Zeke Xie},
  journal= {arXiv preprint arXiv:2411.09502},
  year   = {2025}
}