CLIP-GEN:利用 CLIP 进行文本到图像生成器的无语言训练
计算机视觉与模式识别
2022-03-02 v1
摘要
在通用领域训练文本到图像生成器(例如 Dall.e、CogView)需要海量的成对文本-图像数据,其收集成本过高。本文提出了一种名为 CLIP-GEN 的自监督方案,利用预训练 CLIP 模型提取的语言-图像先验进行通用文本到图像生成。在我们的方法中,仅需一组通用领域的无标签图像即可训练文本到图像生成器。具体来说,给定一张无文本标签的图像,我们首先使用 CLIP 的图像编码器在统一的语言-视觉嵌入空间中提取该图像的嵌入。接着,我们将图像转换为 VQGAN 码本空间中的一系列离散令牌(VQGAN 模型可使用手头的无标签图像数据集进行训练)。最后,我们训练一个自回归 Transformer,将图像令牌从其统一的语言-视觉表示中映射出来。训练完成后,该 Transformer 可以根据输入文本,从 CLIP 文本编码器提取的文本嵌入生成连贯的图像令牌。这种策略使我们能够利用大型无文本图像数据集(如 ImageNet)训练一个强大且通用的文本到图像生成器。定性和定量评估验证了我们的方法在图像质量上显著优于基于优化的文本到图像方法,同时不损害文本-图像匹配度。我们的方法甚至可以达到与 CogView 等旗舰监督模型相当的性能。
引用
@article{arxiv.2203.00386,
title = {CLIP-GEN: Language-Free Training of a Text-to-Image Generator with CLIP},
author = {Zihao Wang and Wei Liu and Qian He and Xinglong Wu and Zili Yi},
journal= {arXiv preprint arXiv:2203.00386},
year = {2022}
}