X&Fuse:文本到图像生成中的视觉信息融合
计算机视觉与模式识别
2023-03-03 v1 人工智能
摘要
我们提出X&Fuse,一种在从文本生成图像时以视觉信息为条件的通用方法。我们在三种不同的文本到图像生成场景中展示了X&Fuse的潜力。(i)当可用图像库时,我们检索并基于相关图像作为条件(Retrieve&Fuse),在MS-COCO基准上取得显著提升,在零样本设定下获得6.65的SOTA FID分数。(ii)当手头有裁剪目标图像时,我们利用它们进行主体驱动生成(Crop&Fuse),优于文本反演方法且速度快100倍以上。(iii)若可神谕访问图像场景(Scene&Fuse),使我们在零样本设定下于MS-COCO上达到5.03的FID分数。我们的实验表明,在模型可受益于额外视觉信息的场景中,X&Fuse是一种有效、易适配、简单且通用的方法。
引用
@article{arxiv.2303.01000,
title = {X&Fuse: Fusing Visual Information in Text-to-Image Generation},
author = {Yuval Kirstain and Omer Levy and Adam Polyak},
journal= {arXiv preprint arXiv:2303.01000},
year = {2023}
}