中文

基于全局-区域先验的创意图像超分

计算机视觉与模式识别 2025-05-23 v1 多媒体

摘要

当前的扩散模型在文本到图像生成方面展现出显著能力,但仍受限于有限分辨率(例如 1,024×1,024)。近期进展通过复用预训练扩散模型并借助区域去噪或膨胀采样/卷积对其进行扩展,实现了无微调的高分辨率图像生成。然而,这些模型难以同时保持全局语义结构并在高分辨率图像中生成创意性的区域细节。为此,我们提出 C-Upscale,一种以全局-区域先验为基础的无微调图像超分新方案,该先验来源于给定的全局提示并通过多模态大语言模型估计区域提示。技术上,低分辨率图像的低频分量被识别为全局结构先验,以鼓励高分辨率生成中的全局语义一致性。接下来,我们执行区域注意力控制,在区域去噪过程中筛选全局提示与每个区域之间的交叉注意力,从而产生缓解目标重复问题的区域注意力先验。包含丰富描述性细节的估计区域提示进一步充当区域语义先验,为区域细节生成的创意性提供动力。定量和定性评估均表明,我们的 C-Upscale 能够生成超高分辨率图像(例如 4,096×4,096 和 8,192×8,192),具有更高的视觉保真度和更多创意性的区域细节。

关键词

引用

@article{arxiv.2505.16976,
  title  = {Creatively Upscaling Images with Global-Regional Priors},
  author = {Yurui Qian and Qi Cai and Yingwei Pan and Ting Yao and Tao Mei},
  journal= {arXiv preprint arXiv:2505.16976},
  year   = {2025}
}

备注

International Journal of Computer Vision (IJCV) 2025