中文

LAFITE:面向无文本训练的文本到图像生成

计算机视觉与模式识别 2022-03-25 v3 机器学习

摘要

训练文本到图像生成模型的主要挑战之一是需要大量高质量图文对。虽然图像样本通常易于获取,但相关的文本描述一般需要细致的人工标注,这尤其耗时且昂贵。本文中,我们提出首项无需任何文本数据训练文本到图像生成模型的工作。我们的方法利用强大预训练CLIP模型良好对齐的多模态语义空间:通过从图像特征生成文本特征,文本条件化的需求被无缝缓解。我们进行了大量实验以说明所提方法的有效性。我们在标准文本到图像生成任务中取得最先进(SOTA)结果。重要的是,所提无语言模型优于多数使用完整图文对训练的现有模型。此外,我们的方法可应用于微调预训练模型,从而在训练文本到图像生成模型时节省训练时间与成本。我们的预训练模型在MS-COCO数据集的零样本文本到图像生成上取得有竞争力结果,而模型规模与训练数据规模仅约为近期提出的大型DALL-E模型的1%。

关键词

引用

@article{arxiv.2111.13792,
  title  = {LAFITE: Towards Language-Free Training for Text-to-Image Generation},
  author = {Yufan Zhou and Ruiyi Zhang and Changyou Chen and Chunyuan Li and Chris Tensmeyer and Tong Yu and Jiuxiang Gu and Jinhui Xu and Tong Sun},
  journal= {arXiv preprint arXiv:2111.13792},
  year   = {2022}
}

备注

Accepted by CVPR 2022, https://github.com/drboog/Lafite