中文

单GPU足够吗?利用基础模型推动更高分辨率图像生成

计算机视觉与模式识别 2024-10-25 v3 人工智能

摘要

在这项工作中,我们介绍了Pixelsmith,一个零样本文本到图像生成框架,能够在单个GPU上采样更高分辨率的图像。我们首次证明,可以将预训练扩散模型的输出缩放1000倍,从而以零额外成本开辟千兆像素图像生成之路。我们的级联方法使用最低分辨率生成的图像作为基线,以采样更高分辨率。为了引导,我们引入了Slider,一种可调机制,它将首张生成图像中包含的整体结构与增强的精细细节融合。在每个推理步骤中,我们对图像块进行去噪,而不是对整个潜在空间进行去噪,从而最小化内存需求,使得单个GPU能够处理该过程,无论图像分辨率如何。我们的实验结果表明,Pixelsmith不仅比现有技术实现了更高的质量和多样性,而且还减少了采样时间和伪影。我们的代码可在https://github.com/Thanos-DB/Pixelsmith获取。

关键词

引用

@article{arxiv.2406.07251,
  title  = {Is One GPU Enough? Pushing Image Generation at Higher-Resolutions with Foundation Models},
  author = {Athanasios Tragakis and Marco Aversa and Chaitanya Kaul and Roderick Murray-Smith and Daniele Faccio},
  journal= {arXiv preprint arXiv:2406.07251},
  year   = {2024}
}