中文

BLIP-Diffusion:用于可控文本到图像生成与编辑的预训练主体表示

计算机视觉与模式识别 2023-06-23 v2 人工智能

摘要

主体驱动的文本到图像生成模型基于文本提示创建输入主体的新颖变体。现有模型存在微调耗时长以及难以保持主体保真度的问题。为克服这些局限,我们引入 BLIP-Diffusion,一种新颖的主体驱动图像生成模型,支持多模态控制,可接收主体图像与文本提示作为输入。与其他主体驱动生成模型不同,BLIP-Diffusion 引入了新预训练的多模态编码器以提供主体表示。我们首先遵循 BLIP-2 预训练多模态编码器以产生与文本对齐的视觉表示。随后设计主体表示学习任务,使扩散模型能够利用此类视觉表示并生成新的主体变体。与 DreamBooth 等先前方法相比,我们的模型支持零样本主体驱动生成,并为定制主体提供高效微调,最高实现 20 倍加速。我们还展示 BLIP-Diffusion 可灵活结合 ControlNet 和 prompt-to-prompt 等现有技术,实现新颖的主体驱动生成与编辑应用。代码与模型将于 https://github.com/salesforce/LAVIS/tree/main/projects/blip-diffusion 发布。项目主页见 https://dxli94.github.io/BLIP-Diffusion-website/。

关键词

引用

@article{arxiv.2305.14720,
  title  = {BLIP-Diffusion: Pre-trained Subject Representation for Controllable Text-to-Image Generation and Editing},
  author = {Dongxu Li and Junnan Li and Steven C. H. Hoi},
  journal= {arXiv preprint arXiv:2305.14720},
  year   = {2023}
}