中文

MaxFusion:文本到图像扩散模型中的即插即用多模态生成

计算机视觉与模式识别 2024-04-16 v1

摘要

大型基于扩散的文本到图像(T2I)模型在文本到图像生成以及空间条件图像生成方面展现出了令人印象深刻的生成能力。对于大多数应用,我们可以使用配对数据对模型进行端到端训练,以获得逼真的生成质量。然而,为了添加额外的任务,人们通常需要使用跨所有模态的配对数据从头开始重新训练模型,以保持良好的生成性能。在本文中,我们解决了这个问题,并提出了一种新颖的策略,以最小的计算量将生成模型扩展到新任务。在我们的实验中,我们发现扩散模型中间特征图的方差图捕获了条件强度。利用这一先验信息,我们提出了 MaxFusion,一种有效的策略,用于扩展文本到图像生成模型以适应新的模态条件。具体而言,我们结合了多个模型的对齐特征,从而带来组合效应。我们的融合策略可以集成到现成的模型中,以增强其生成能力。

关键词

引用

@article{arxiv.2404.09977,
  title  = {MaxFusion: Plug&Play Multi-Modal Generation in Text-to-Image Diffusion Models},
  author = {Nithin Gopalakrishnan Nair and Jeya Maria Jose Valanarasu and Vishal M Patel},
  journal= {arXiv preprint arXiv:2404.09977},
  year   = {2024}
}