中文

量化潜空间中文本与图像条件图像合成的新采样方案

计算机视觉与模式识别 2023-05-24 v2 机器学习

摘要

文本到图像合成领域的近期进展在质量、保真度与多样性方面带来了诸多提升。当代技术能够生成高度复杂的视觉图像,并迅速接近照片级真实质量。然而,随着进展取得,这些方法的复杂性增加,进而加剧了领域内与领域外人员之间的理解壁垒。为缓解此差距,我们提出一种简化的文本到图像生成方法,涵盖训练范式与采样过程。尽管极为简单,我们的方法能以少量采样迭代生成美观图像,允许以有趣的方式对模型进行条件化,并带来最先进技术所不具备的优势。为展示该方法在取得与现有工作可比结果上的有效性,我们训练了一个十亿参数的文本条件模型,称之为“Paella”。为促进该领域未来探索,我们已向研究界公开源代码与模型。

关键词

引用

@article{arxiv.2211.07292,
  title  = {A Novel Sampling Scheme for Text- and Image-Conditional Image Synthesis in Quantized Latent Spaces},
  author = {Dominic Rampas and Pablo Pernias and Marc Aubreville},
  journal= {arXiv preprint arXiv:2211.07292},
  year   = {2023}
}