基于频率感知的级联抽样高效生成高分辨率图像
计算机视觉与模式识别
2025-02-28 v2
摘要
尽管扩散模型在图像生成方面取得了巨大成功,但生成超过训练尺寸的高分辨率图像仍然具有高计算成本的挑战。当前方法通常在完整分辨率下进行整个抽样过程,并同时处理所有频率分量,这与潜在扩散模型固有的从粗到细本质相矛盾,并在早期扩散阶段浪费了对初期高频细节的计算。为此,我们引入了一种高效的 quency-aware scaded ampling 框架,简称为 ,用于高分辨率图像生成。FreCaS 将抽样过程分解为逐级分辨率递增的阶段,逐步扩大频率带并细化相应细节。我们提出了一种创新的频率感知无分类器引导(FA-CFG)策略,为不同频率分量分配不同的引导强度,引导扩散模型在每个阶段扩张的频率域中添加新细节。此外,我们融合前一阶段和当前阶段的注意力图,以避免合成不忠实的布局。实验表明,FreCaS 在图像质量和生成速度方面显著优于 SOTA 方法。特别是,FreCaS 在使用预训练 SDXL 模型生成 20482048 图像时,分别比 ScaleCrafter 和 DemoFusion 快 2.86 和 6.07,并实现 FID 提升 11.6 和 3.7。FreCaS 可以轻松扩展到更复杂的模型,如 SD3。FreCaS 的源码可在 https://github.com/xtudbxk/FreCaS 查看。
引用
@article{arxiv.2410.18410,
title = {FreCaS: Efficient Higher-Resolution Image Generation via Frequency-aware Cascaded Sampling},
author = {Zhengqiang Zhang and Ruihuang Li and Lei Zhang},
journal= {arXiv preprint arXiv:2410.18410},
year = {2025}
}