中文

基于频率感知的级联抽样高效生成高分辨率图像

计算机视觉与模式识别 2025-02-28 v2

摘要

尽管扩散模型在图像生成方面取得了巨大成功,但生成超过训练尺寸的高分辨率图像仍然具有高计算成本的挑战。当前方法通常在完整分辨率下进行整个抽样过程,并同时处理所有频率分量,这与潜在扩散模型固有的从粗到细本质相矛盾,并在早期扩散阶段浪费了对初期高频细节的计算。为此,我们引入了一种高效的 Fre\textbf{Fre}quency-aware Ca\textbf{Ca}scaded S\textbf{S}ampling 框架,简称为 FreCaS\textbf{FreCaS},用于高分辨率图像生成。FreCaS 将抽样过程分解为逐级分辨率递增的阶段,逐步扩大频率带并细化相应细节。我们提出了一种创新的频率感知无分类器引导(FA-CFG)策略,为不同频率分量分配不同的引导强度,引导扩散模型在每个阶段扩张的频率域中添加新细节。此外,我们融合前一阶段和当前阶段的注意力图,以避免合成不忠实的布局。实验表明,FreCaS 在图像质量和生成速度方面显著优于 SOTA 方法。特别是,FreCaS 在使用预训练 SDXL 模型生成 2048×\times2048 图像时,分别比 ScaleCrafter 和 DemoFusion 快 2.86×\times 和 6.07×\times,并实现 FIDb_b 提升 11.6 和 3.7。FreCaS 可以轻松扩展到更复杂的模型,如 SD3。FreCaS 的源码可在 https://github.com/xtudbxk/FreCaS 查看。

关键词

引用

@article{arxiv.2410.18410,
  title  = {FreCaS: Efficient Higher-Resolution Image Generation via Frequency-aware Cascaded Sampling},
  author = {Zhengqiang Zhang and Ruihuang Li and Lei Zhang},
  journal= {arXiv preprint arXiv:2410.18410},
  year   = {2025}
}