中文

FreSca:频率空间缩放增强扩散模型

计算机视觉与模式识别 2025-05-30 v3

摘要

Latent diffusion models (LDMs) 在各种图像任务中取得了显著成功,但实现对全局结构与精细细节的细粒度、解耦控制仍然具有挑战性。本文探讨了 latent diffusion models 中基于频率的控制。我们首先系统分析了像素空间、VAE 潜空间和内部 LDM 表示中的频率特性。这揭示了在每一步 t 由无分类器导出的“噪声差”项是一个独特有效且语义丰富的操作目标。基于这一见解,我们引入了 FreSca,这是一个新颖的即插即用框架,它将噪声差分解为低频和高频分量,并通过空间或基于能量的截断对它们应用独立的缩放因子。本质上,FreSca 无需任何模型重训或架构更改即可运行,提供与模型和任务无关的控制。我们在多种架构(如 SD3、SDXL)以及包括图像生成、编辑、深度估计和视频合成在内的应用中,展示了其在提高生成质量和结构强调方面的多功能性和有效性,从而在 LDMs 中解锁了表现力控制的新维度。

关键词

引用

@article{arxiv.2504.02154,
  title  = {FreSca: Scaling in Frequency Space Enhances Diffusion Models},
  author = {Chao Huang and Susan Liang and Yunlong Tang and Jing Bi and Li Ma and Yapeng Tian and Chenliang Xu},
  journal= {arXiv preprint arXiv:2504.02154},
  year   = {2025}
}

备注

Project page: https://wikichao.github.io/FreSca/