量化潜空间中文本与图像条件图像合成的新采样方案
计算机视觉与模式识别
2023-05-24 v2 机器学习
摘要
文本到图像合成领域的近期进展在质量、保真度与多样性方面带来了诸多提升。当代技术能够生成高度复杂的视觉图像,并迅速接近照片级真实质量。然而,随着进展取得,这些方法的复杂性增加,进而加剧了领域内与领域外人员之间的理解壁垒。为缓解此差距,我们提出一种简化的文本到图像生成方法,涵盖训练范式与采样过程。尽管极为简单,我们的方法能以少量采样迭代生成美观图像,允许以有趣的方式对模型进行条件化,并带来最先进技术所不具备的优势。为展示该方法在取得与现有工作可比结果上的有效性,我们训练了一个十亿参数的文本条件模型,称之为“Paella”。为促进该领域未来探索,我们已向研究界公开源代码与模型。
引用
@article{arxiv.2211.07292,
title = {A Novel Sampling Scheme for Text- and Image-Conditional Image Synthesis in Quantized Latent Spaces},
author = {Dominic Rampas and Pablo Pernias and Marc Aubreville},
journal= {arXiv preprint arXiv:2211.07292},
year = {2023}
}