中文

基于 CLIP 引导生成潜空间搜索的从描述生成图像及反与之法

神经与进化计算 2021-10-04 v4 人工智能 机器学习

摘要

在本研究工作中,我们提出 CLIP-GLaSS,一种新颖的零样本框架,用于生成与给定描述(或图像)相对应的图像(或描述)。CLIP-GLaSS 基于 CLIP 神经网络,其在给定图像与描述性描述时提供相似嵌入。不同之处在于,CLIP-GLaSS 以描述(或图像)作为输入,并生成其 CLIP 嵌入与输入嵌入最相似的图像(或描述)。该最优图像(或描述)由生成网络在经过遗传算法探索后产生。基于图像生成器 BigGAN 与 StyleGAN2 以及文本生成器 GPT2 的实验,展示了有前景的结果。

关键词

引用

@article{arxiv.2102.01645,
  title  = {Generating images from caption and vice versa via CLIP-Guided Generative Latent Space Search},
  author = {Federico A. Galatolo and Mario G. C. A. Cimino and Gigliola Vaglini},
  journal= {arXiv preprint arXiv:2102.01645},
  year   = {2021}
}