基于 CLIP 引导生成潜空间搜索的从描述生成图像及反与之法
神经与进化计算
2021-10-04 v4 人工智能
机器学习
摘要
在本研究工作中,我们提出 CLIP-GLaSS,一种新颖的零样本框架,用于生成与给定描述(或图像)相对应的图像(或描述)。CLIP-GLaSS 基于 CLIP 神经网络,其在给定图像与描述性描述时提供相似嵌入。不同之处在于,CLIP-GLaSS 以描述(或图像)作为输入,并生成其 CLIP 嵌入与输入嵌入最相似的图像(或描述)。该最优图像(或描述)由生成网络在经过遗传算法探索后产生。基于图像生成器 BigGAN 与 StyleGAN2 以及文本生成器 GPT2 的实验,展示了有前景的结果。
引用
@article{arxiv.2102.01645,
title = {Generating images from caption and vice versa via CLIP-Guided Generative Latent Space Search},
author = {Federico A. Galatolo and Mario G. C. A. Cimino and Gigliola Vaglini},
journal= {arXiv preprint arXiv:2102.01645},
year = {2021}
}