中文

Emage:非自回归文本到图像生成

计算机视觉与模式识别 2023-12-27 v1

摘要

自回归模型和扩散模型推动了文本到图像生成的近期突破。尽管这些模型在生成高逼真度图像方面取得了巨大成功,但它们的一个共同缺点是推理延迟高——自回归模型需要连续运行上千次以生成图像 token,而扩散模型则需要数百个去噪步骤将高斯噪声转化为图像。在本工作中,我们探索了能够高效并行生成数百个图像 token 的非自回归文本到图像模型。我们开发了具有不同学习与推理策略、初始化文本编码器等的多种模型变体。与需要运行一千次的自回归基线相比,我们的模型仅需运行 16 次即可生成质量具有竞争力的图像,且推理延迟低了一个数量级。我们具有 346M 参数的非自回归模型在单块 V100 GPU 上生成一张 256×\times256 的图像仅需约一秒。

关键词

引用

@article{arxiv.2312.14988,
  title  = {Emage: Non-Autoregressive Text-to-Image Generation},
  author = {Zhangyin Feng and Runyi Hu and Liangxin Liu and Fan Zhang and Duyu Tang and Yong Dai and Xiaocheng Feng and Jiwei Li and Bing Qin and Shuming Shi},
  journal= {arXiv preprint arXiv:2312.14988},
  year   = {2023}
}