Emage:非自回归文本到图像生成
计算机视觉与模式识别
2023-12-27 v1
摘要
自回归模型和扩散模型推动了文本到图像生成的近期突破。尽管这些模型在生成高逼真度图像方面取得了巨大成功,但它们的一个共同缺点是推理延迟高——自回归模型需要连续运行上千次以生成图像 token,而扩散模型则需要数百个去噪步骤将高斯噪声转化为图像。在本工作中,我们探索了能够高效并行生成数百个图像 token 的非自回归文本到图像模型。我们开发了具有不同学习与推理策略、初始化文本编码器等的多种模型变体。与需要运行一千次的自回归基线相比,我们的模型仅需运行 16 次即可生成质量具有竞争力的图像,且推理延迟低了一个数量级。我们具有 346M 参数的非自回归模型在单块 V100 GPU 上生成一张 256256 的图像仅需约一秒。
引用
@article{arxiv.2312.14988,
title = {Emage: Non-Autoregressive Text-to-Image Generation},
author = {Zhangyin Feng and Runyi Hu and Liangxin Liu and Fan Zhang and Duyu Tang and Yong Dai and Xiaocheng Feng and Jiwei Li and Bing Qin and Shuming Shi},
journal= {arXiv preprint arXiv:2312.14988},
year = {2023}
}