中文

GlueGen:用于 X 到图像生成的即插即用多模态编码器

计算机视觉与模式识别 2023-11-03 v2 多媒体

摘要

基于扩散过程的文本到图像(T2I)模型在利用用户提供的描述进行可控图像生成方面取得了显著成功。然而,当前 T2I 模型中文本编码器与图像解码器的紧密耦合使得替换或升级十分困难。此类改动往往需要大量微调甚至从头训练,代价高昂。为解决该问题,我们提出 GlueGen,其应用新提出的 GlueNet 模型将单模态或多模态编码器的特征与现有 T2I 模型的潜空间对齐。该方法引入了一种新的训练目标,利用平行语料库对齐不同编码器的表示空间。实证结果表明,GlueNet 可被高效训练,并实现了超越先前最先进模型的多项能力:1)可将 XLM-Roberta 等多语言语言模型与现有 T2I 模型对齐,从而支持以英语以外描述生成高质量图像;2)GlueNet 可将 AudioCLIP 等多模态编码器与 Stable Diffusion 模型对齐,实现声音到图像生成;3)它还可升级潜扩散模型当前的文本编码器以应对挑战性案例生成。通过对各种特征表示的对齐,GlueNet 实现了将新功能灵活高效地集成到现有 T2I 模型中,并为 X 到图像(X2I)生成提供了思路。

关键词

引用

@article{arxiv.2303.10056,
  title  = {GlueGen: Plug and Play Multi-modal Encoders for X-to-image Generation},
  author = {Can Qin and Ning Yu and Chen Xing and Shu Zhang and Zeyuan Chen and Stefano Ermon and Yun Fu and Caiming Xiong and Ran Xu},
  journal= {arXiv preprint arXiv:2303.10056},
  year   = {2023}
}

备注

ICCV 2023