稳定图像自回归建模的潜在空间:一种统一视角
计算机视觉与模式识别
2024-11-01 v2 人工智能
摘要
潜在空间的图像生成模型,如潜在扩散模型(LDMs)和掩码图像模型(MIMs),在图像生成任务中取得了显著的成功。这类模型通常利用如VQGAN或VAE的重构自编码器将像素编码为更紧凑的潜在空间,并在潜在空间中学习数据分布,而不是直接从像素学习。在此基础上,一个值得关注的问题是:这是否 truly 是最佳选择?为了回应此问题,我们首先提出了一个引人注目的观察:尽管共享相同的潜在空间,自回归模型在图像生成方面仍显著落后于LDMs和MIMs。这一发现与NLP领域的自回归模型GPT已建立显著优势的现象形成鲜明对比。为了解决这一差异,我们引入一种关于潜在空间与生成模型之间关系的统一视角,强调图像生成建模中潜在空间稳定性的重要性。此外,我们提出了一种简单而有效的离散图像词典化器,通过对自监督学习模型的潜在特征应用K-均值聚类来稳定图像生成建模的潜在空间。实验结果表明,我们的词典化器(DiGIT)用于图像自回归建模在图像理解和图像生成方面都能带来好处,采用下一个标记预测原则,这在GPT模型中是天然的,但对其他生成模型而言则具有挑战性。令人惊讶的是,首次出现一种GPT风格的自回归模型用于图像生成,可超过LDMs,这也表现出类似GPT时放大模型规模时所表现出的显著改进。我们的发现凸显了优化潜在空间和离散词典化在推进图像生成模型能力方面的潜力。代码可在\url{https://github.com/DAMO-NLP-SG/DiGIT}获取。
引用
@article{arxiv.2410.12490,
title = {Stabilize the Latent Space for Image Autoregressive Modeling: A Unified Perspective},
author = {Yongxin Zhu and Bocheng Li and Hang Zhang and Xin Li and Linli Xu and Lidong Bing},
journal= {arXiv preprint arXiv:2410.12490},
year = {2024}
}
备注
Accepted at NeurIPS 2024