中文

Diffusion-4K: 基于潜在扩散模型的超高分辨率图像合成

计算机视觉与模式识别 2025-12-19 v2

摘要

本文提出了Diffusion-4K, 一个用于直接超高分辨率图像合成的新型框架, 基于文本到图像扩散模型. 核心进展包括: (1) Aesthetic-4K基准: 针对缺乏公开可用的4K图像合成数据集, 我们构建Aesthetic-4K, 一个用于超高分辨率图像生成的全面基准. 我们精选了高质量的4K数据集, 并由GPT-4o生成 carefully selected images and captions. 此外, 我们引入GLCM得分和压缩比指标来评估细节, 结合FID、Aesthetics和CLIPScore等整体措施, 全面评估超高分辨率图像. (2) 小波化微调: 我们提出一种针对直接训练具有照片级4K图像的方法, 可适用于各种潜在扩散模型, 证明其在合成高度细节的4K图像方面的有效性. 因此, Diffusion-4K在高质量图像合成和文本提示遵循方面实现了卓越的性能, 尤其是当由现代大规模扩散模型(如SD3-2B和Flux-12B) 提供动力时. 大量实验结果表明, Diffusion-4K在超高分辨率图像合成方面优于现有方法.

关键词

引用

@article{arxiv.2503.18352,
  title  = {Diffusion-4K: Ultra-High-Resolution Image Synthesis with Latent Diffusion Models},
  author = {Jinjin Zhang and Qiuyu Huang and Junjie Liu and Xiefan Guo and Di Huang},
  journal= {arXiv preprint arXiv:2503.18352},
  year   = {2025}
}

备注

Accepted to CVPR 2025