CogView2:基于分层 Transformer 实现更快速更优的文本到图像生成
计算机视觉与模式识别
2022-05-30 v2 机器学习
摘要
基于 transformer 的文本到图像模型的发展受其缓慢的生成速度以及对高分辨率图像的复杂性所阻碍。在本工作中,我们提出了一种基于分层 transformer 与局部并行自回归生成的解决方案。我们以一个简单灵活的自我监督任务——跨模态通用语言模型(CogLM)预训练了一个 60 亿参数的 transformer,并对其进行微调以实现快速超分辨率。这一新的文本到图像系统 CogView2 在与同期最先进的 DALL-E-2 相比时展现出极具竞争力的生成效果,并且天然支持基于交互式文本引导的图像编辑。
引用
@article{arxiv.2204.14217,
title = {CogView2: Faster and Better Text-to-Image Generation via Hierarchical Transformers},
author = {Ming Ding and Wendi Zheng and Wenyi Hong and Jie Tang},
journal= {arXiv preprint arXiv:2204.14217},
year = {2022}
}