超高分辨率图像合成:数据、方法与评估
计算机视觉与模式识别
2025-06-03 v1
摘要
超高分辨率图像合成具有巨大潜力,但由于缺乏标准化基准和计算限制,这仍是一个尚未充分探索的挑战。在本文中,我们构建了 Aesthetic-4K,一个精心策划的数据集,包含专门的训练和评估子集,专为超高分辨率图像合成的全面研究而设计。该数据集由高质量的 4K 图像组成,并配有由 GPT-4o 生成的描述性标题。此外,我们提出了 Diffusion-4K,一个用于直接生成超高分辨率图像的创新框架。我们的方法结合了尺度一致变分自编码器 (SC-VAE) 和基于小波的潜在微调 (WLF),旨在实现高效的视觉 token 压缩并捕捉超高分辨率图像中的复杂细节,从而促进使用逼真的 4K 数据进行直接训练。该方法适用于各种潜在扩散模型,并在合成高度细节的 4K 图像方面证明了其有效性。此外,我们提出了新的指标,即 GLCM Score 和 Compression Ratio,用于评估局部图像块中的纹理丰富度和精细细节,结合 FID、Aesthetics 和 CLIPScore 等整体指标,实现了对超高分辨率图像合成的全面多维度评估。因此,Diffusion-4K 在超高分辨率图像合成中取得了令人瞩目的性能,特别是在最先进的大规模扩散模型(例如 Flux-12B)的驱动下。源代码公开于 https://github.com/zhang0jhon/diffusion-4k。
引用
@article{arxiv.2506.01331,
title = {Ultra-High-Resolution Image Synthesis: Data, Method and Evaluation},
author = {Jinjin Zhang and Qiuyu Huang and Junjie Liu and Xiefan Guo and Di Huang},
journal= {arXiv preprint arXiv:2506.01331},
year = {2025}
}