中文

Lafite2:少样本文本到图像生成

计算机视觉与模式识别 2022-10-26 v1 人工智能

摘要

近年来,文本到图像生成模型取得了显著进展,现已能从任意文本生成令人惊叹的真实图像。此类模型大多在网页规模的图文配对数据集上训练,这对许多研究者而言可能难以负担。在本文中,我们提出一种在仅含图像的数据集上预训练文本到图像生成模型的新方法。它采用“先检索后优化”的流程来合成伪文本特征:对给定图像,先检索相关的伪文本特征,再对其进行优化以获得更好的对齐。该方法较低的资源需求带来了高度的灵活性与可用性:它可惠及多种设定,包括少样本、半监督与全监督学习;它可应用于不同模型,包括生成对抗网络(GANs)和扩散模型。大量实验证明了所提方法的有效性。在 MS-COCO 数据集上,我们的 GAN 模型取得了 6.78 的 Fréchet Inception Distance(FID),这是全监督设定下 GAN 的新最优(SoTA)。我们的扩散模型在零样本与有监督设定下分别取得 8.42 和 4.28 的 FID,在模型规模小得多的情况下与 SoTA 扩散模型相当。

关键词

引用

@article{arxiv.2210.14124,
  title  = {Lafite2: Few-shot Text-to-Image Generation},
  author = {Yufan Zhou and Chunyuan Li and Changyou Chen and Jianfeng Gao and Jinhui Xu},
  journal= {arXiv preprint arXiv:2210.14124},
  year   = {2022}
}