MarkovGen:用于高效文本到图像生成的结构化预测
计算机视觉与模式识别
2023-12-19 v3 人工智能
机器学习
摘要
现代文本到图像生成模型生成高质量图像,这些图像既逼真又忠实于文本提示。然而,这种质量伴随着显著的计算成本:几乎所有这类模型都是迭代的,需要使用大型模型多次运行采样。这种迭代过程是确保图像不同区域不仅与文本提示对齐,而且彼此兼容所必需的。在这项工作中,我们提出了一种轻量级方法,使用马尔可夫随机场(MRF)模型来实现图像不同区域之间的这种兼容性。我们在基于潜在token的Muse文本到图像模型上展示了该方法的有效性。MRF丰富地编码了不同空间位置的图像token之间的兼容性,以提高质量并显著减少所需的Muse采样步数。使用MRF进行推理显著更便宜,并且通过将对MRF推理建模为可微神经网络层,其参数可以通过反向传播快速学习。我们的完整模型MarkovGen使用这种提出的MRF模型,既将Muse加速1.5倍,又通过减少不良图像伪影来生成更高质量的图像。
引用
@article{arxiv.2308.10997,
title = {MarkovGen: Structured Prediction for Efficient Text-to-Image Generation},
author = {Sadeep Jayasumana and Daniel Glasner and Srikumar Ramalingam and Andreas Veit and Ayan Chakrabarti and Sanjiv Kumar},
journal= {arXiv preprint arXiv:2308.10997},
year = {2023}
}