Kaleido扩散:通过自回归潜在建模改进条件扩散模型
计算机视觉与模式识别
2024-06-03 v1
摘要
扩散模型已成为从文本描述生成高质量图像的强大工具。尽管取得了成功,但这些模型在采样图像时通常表现出有限的多样性,特别是在使用高无分类器引导权重采样时。为了解决这个问题,我们提出了Kaleido,一种通过结合自回归潜在先验来增强样本多样性的新方法。Kaleido集成了一个自回归语言模型,该模型对原始标题进行编码并生成潜在变量,作为抽象和中间表示来指导和促进图像生成过程。在本文中,我们探索了多种离散潜在表示,包括文本描述、检测边界框、对象斑点和视觉标记。这些表示多样化并丰富了扩散模型的输入条件,从而实现了更多样化的输出。我们的实验结果表明,Kaleido有效地拓宽了从给定文本描述生成的图像样本的多样性,同时保持了高图像质量。此外,我们展示了Kaleido紧密遵循生成的潜在变量提供的指导,证明了其有效控制和指导图像生成过程的能力。
引用
@article{arxiv.2405.21048,
title = {Kaleido Diffusion: Improving Conditional Diffusion Models with Autoregressive Latent Modeling},
author = {Jiatao Gu and Ying Shen and Shuangfei Zhai and Yizhe Zhang and Navdeep Jaitly and Joshua M. Susskind},
journal= {arXiv preprint arXiv:2405.21048},
year = {2024}
}
备注
22 pages, 14 figures