FreeScale: 通过无调参尺度融合释放扩散模型的分辨率潜力
计算机视觉与模式识别
2025-07-14 v2
摘要
视觉扩散模型取得了显著进展,但通常在受限分辨率下训练,由于缺乏高分辨率数据和受限计算资源,限制了其在更高分辨率下生成高保真图像或视频的能力。近期的研究探索了无需调参的策略,以发掘预训练模型在更高分辨率视觉生成的潜力。然而,这些方法仍容易产生低质量视觉内容,出现重复模式。关键障碍在于,当模型生成超过训练分辨率的视觉内容时,高频信息不可避免地增加,导致误差累积产生令人不可接受的重复模式。为此,我们提出FreeScale,一种无需调参的推理范式,通过尺度融合实现更高分辨率的视觉生成。具体而言,FreeScale 处理来自不同感受野尺度的信息,然后通过提取所需频率分量进行融合。大量实验验证了该范式在扩展图像和视频模型的更高分辨率视觉生成能力方面的优势。值得注意的是,与先前最佳方法相比,FreeScale 首次实现了8K分辨率的文本到图像生成。
引用
@article{arxiv.2412.09626,
title = {FreeScale: Unleashing the Resolution of Diffusion Models via Tuning-Free Scale Fusion},
author = {Haonan Qiu and Shiwei Zhang and Yujie Wei and Ruihang Chu and Hangjie Yuan and Xiang Wang and Yingya Zhang and Ziwei Liu},
journal= {arXiv preprint arXiv:2412.09626},
year = {2025}
}
备注
ICCV 2025, Project Page: http://haonanqiu.com/projects/FreeScale.html, Code Repo: https://github.com/ali-vilab/FreeScale