中文

MultiFusion:融合预训练模型实现多语言多模态图像生成

计算机视觉与模式识别 2023-12-21 v3 人工智能 机器学习

摘要

近期文本到图像扩散模型(DM)的流行在很大程度上可归因于其为用户提供的直观接口。预期的生成内容可用自然语言表述,模型则对文本提示产生忠实的诠释。然而,仅用文本表达复杂或微妙的想法可能较为困难。为简化图像生成,我们提出 MultiFusion,其允许以任意交错的多模态与多语言输入来表达复杂而微妙的概念。MultiFusion 利用预训练模型并将其对齐以集成到一个连贯的系统中,从而避免了从头进行大量训练的需要。我们的实验结果表明了各独立模块能力向下游模型的高效迁移。具体而言,尽管图像生成模块仅在单一语言的单模态数据上训练过,所有独立组件的融合使其得以利用多语言、交错的多模态输入。

关键词

引用

@article{arxiv.2305.15296,
  title  = {MultiFusion: Fusing Pre-Trained Models for Multi-Lingual, Multi-Modal Image Generation},
  author = {Marco Bellagente and Manuel Brack and Hannah Teufel and Felix Friedrich and Björn Deiseroth and Constantin Eichenberg and Andrew Dai and Robert Baldock and Souradeep Nanda and Koen Oostermeijer and Andres Felipe Cruz-Salinas and Patrick Schramowski and Kristian Kersting and Samuel Weinbach},
  journal= {arXiv preprint arXiv:2305.15296},
  year   = {2023}
}

备注

Proceedings of Advances in Neural Information Processing Systems: Annual Conference on Neural Information Processing Systems (NeurIPS)