中文

FuseDream:基于改进 CLIP+GAN 空间优化的免训练文本到图像生成

计算机视觉与模式识别 2022-01-02 v1 计算与语言 机器学习

摘要

从自然语言指令生成图像是一项引人入胜却极具挑战的任务。我们通过结合重训练 CLIP 表征与现成图像生成器(GANs)的能力来处理文本到图像生成,在 GAN 的潜空间中优化以寻找与给定输入文本取得最大 CLIP 分数的图像。相比从零开始训练从文本到图像的生成模型的传统方法,CLIP+GAN 方法是免训练、零样本且可通过不同生成器轻松定制的。然而,在 GAN 空间中优化 CLIP 分数构成一个极具挑战的优化问题,而 Adam 等现成优化器无法产生令人满意的结果。在本工作中,我们提出 FuseDream 流水线,通过三项关键技术改进 CLIP+GAN 方法:1) 一种 AugCLIP 分数,通过对图像引入随机增强使 CLIP 目标更具鲁棒性。2) 一种新颖的初始化与过参数化优化策略,使我们能够高效地在 GAN 空间中的非凸地形中导航。3) 一种组合生成技术,通过利用新颖的双层优化公式,可组合多幅图像以扩展 GAN 空间并克服数据偏置。在不同输入文本的提示下,FuseDream 可生成具有不同物体、背景、艺术风格甚至我们所使用 GAN 训练数据中未出现的全新反事实概念的高质量图像。在数量上,FuseDream 生成的图像在 MS COCO 数据集上取得了顶级的 Inception 分数与 FID 分数,无需额外的架构设计或训练。我们的代码公开于 \url{https://github.com/gnobitab/FuseDream}。

关键词

引用

@article{arxiv.2112.01573,
  title  = {FuseDream: Training-Free Text-to-Image Generation with Improved CLIP+GAN Space Optimization},
  author = {Xingchao Liu and Chengyue Gong and Lemeng Wu and Shujian Zhang and Hao Su and Qiang Liu},
  journal= {arXiv preprint arXiv:2112.01573},
  year   = {2022}
}