InstantBooth:无需测试时微调的个性化文本到图像生成
计算机视觉与模式识别
2023-04-10 v1
摘要
个性化图像生成的最新进展使得预训练的文本到图像模型能够从一组图像中学习新概念。然而,现有的个性化方法通常需要为每个概念进行繁重的测试时微调,这既耗时又难以扩展。我们提出了 InstantBooth,这是一种建立在预训练文本到图像模型基础上的新方法,能够在无需任何测试时微调的情况下实现即时文本引导的图像个性化。我们通过几个主要组件实现了这一点。首先,我们通过将输入图像转换为文本 token,利用可学习的图像编码器学习输入图像的通用概念。其次,为了保持身份的精细细节,我们通过向预训练模型引入少量 adapter 层来学习丰富的视觉特征表示。我们仅在文本-图像对上训练我们的组件,而不使用同一概念的配对图像。与基于测试时微调的方法(如 DreamBooth 和 Textual-Inversion)相比,我们的模型在语言-图像对齐、图像保真度和身份保持方面,能够在未见概念上生成具有竞争力的结果,同时速度快 100 倍。
引用
@article{arxiv.2304.03411,
title = {InstantBooth: Personalized Text-to-Image Generation without Test-Time Finetuning},
author = {Jing Shi and Wei Xiong and Zhe Lin and Hyun Joon Jung},
journal= {arXiv preprint arXiv:2304.03411},
year = {2023}
}
备注
13 pages